AI视频的分水岭时刻:谷歌用两个新功能,把战场从“画质”搬到了“信任”

一年前我要做一条视频,需要的东西是这样一串清单:一台相机、一份脚本、一个会剪辑的人,再加上我自己好几个小时。

现在这串清单只剩一样东西——我得知道自己想要什么,然后把它说出来

7月16日,谷歌在 Google Vids 里同时上线了两个功能:Gemini Omni 和个人数字分身。这两个东西加在一起的效果是,我打一句话进去,出来的是一条能直接发的成片。没有相机,没有麦克风,没有剪辑软件。

我盯着这个更新看了很久,因为它表面上是”又一个 AI 视频工具”,往下扒一层,动的是另一样东西。

图片

它不是生成器,是一个会改片子的搭档

先说清楚 Gemini Omni 到底是什么。它在 2026 年的 Google I/O 上第一次亮相,定位是一个”全能模型”——能接受文字、图片、草图、语音录音,也能接受你已经拍好的素材。

这几个输入源里,最后一项最容易被忽略,但恰恰是分水岭。

它不只会凭空造新片,它能理解你手里已经有的东西,然后改它。

大多数 AI 视频工具停在第一步:你给提示词,它吐一段素材,不满意就重来一遍,像抽卡。Gemini Omni 走的是第二步——第一条片子出来之后,我可以继续跟它对话:换个背景、把光修一下、加个效果、把这一段的场景调整一下。

我不是在时间轴上一帧一帧地拖,我是在跟它聊天

更关键的是,这套修改能力不只对 AI 生成的画面有效。我拿自己手机拍的素材照样能用。厨房里光线很糟的一段,不用重拍,直接跟它说”把光修好”。

这一条的分量比听上去重。它意味着 AI 不再是替代拍摄的另一条路,而是接管了拍摄之后的整个环节。

我自己的判断:真正被取代的不是”拍”,是”剪”。拍摄本来就有大量业余替代方案,手机早就够用了;卡住绝大多数人的一直是拍完之后那几个小时——导入、粗剪、调色、加字、导出。这一环现在被一句话吃掉了。

图片

打个比方:你要的是椅子,不是木工课

我试着找一个不用术语的说法。

老式的视频剪辑,像是从零开始做一把椅子。你得有木头、有工具、有胶水,还得有几个小时的耐心。做出来的椅子好不好,取决于你的手艺。

Gemini Omni 更像是:你把想要的椅子描述给一个人听,那个人手里已经有木头、有工具、有手艺,几分钟后把成品递给你。

这个比方里藏着一个容易被跳过的前提——你得先知道自己要一把什么样的椅子

木料和工具不再稀缺之后,稀缺的是描述能力。这是我在这次更新里看到的最大的一个变化,也是绝大多数讨论都绕开的一点:门槛没有消失,它换了个位置。

以前的门槛在”能不能做出来”,现在的门槛在”能不能说清楚”。前者靠时间和设备解决,后者只能靠脑子。

图片

第二个功能更炸:你的脸和你的声音

现在说第二块,个人数字分身。这个是普通人反应最大的一个。

流程简单到有点可怕:上传一张自拍,再录一小段语音,谷歌就给你建一个数字版的你,能对着镜头念稿子。我打字进去,那个”我”就用我的脸、我的声音,把这些话说出来。

可以把它理解成一个替身演员,只不过这个替身长得和我一模一样,而且只为我一个人工作。

这里的用途已经很明确了。新员工的入职培训视频、公司内部的更新通报——这类内容有两个共同点:需要有个人出镜说话,但内容本身高度重复、更新频繁。以前每改一版就得重录一次,现在改的是文字。

我想强调的是这个功能真正瞄准的场景。它不是给你拍电影用的,它是给”必须有张脸,但没必要真拍”的那一大类内容用的。这类内容在企业内部的体量,远比大多数人以为的大。

图片

谁能用:这次谷歌没有全员放开

值得注意的是,谷歌没有一键给所有人打开。

Gemini Omni 和个人分身,面向的是 Google AI Pro 和 Ultra 订阅用户,以及符合条件的 Google Workspace 企业客户。

这个投放范围本身就是一个信号。Google Vids 本来就长在 Workspace 里面——和成千上万家企业放文档、表格、幻灯片的是同一个地方。谷歌自己说过,过去一年里已经有数百万条视频是用 Vids 做出来的,这还是在这次更新落地之前。

所以这不是一个你得专门去找、去下载、去注册的新 App。它是加在一个你每天都会打开的工具上面的。

这条我认为是整件事里最容易被低估的一点。新工具的死亡率极高,不是因为不好用,是因为没人记得打开。而这次的分发路径,是直接塞进已有的工作流里。

图片

企业侧留了开关,这不是小事

谷歌还在里面加了一层管理权限。

企业的管理员可以通过 Workspace 管理控制台,管理甚至直接关掉整个团队的个人分身功能。

一个老板不会被默认打开的功能绑架,这是一个选择题,不是一道必答题。

我为什么专门拿出一节讲这个?因为它说明谷歌很清楚数字分身这东西在企业里的真实处境——它同时是效率工具和风险源。一家公司里如果每个人都能生成一个会说话的自己,那么”这段视频到底是不是他本人说的”就会变成一个需要制度回答的问题。

给出开关,本质上是承认这个功能需要被治理。 这比功能本身更能说明谷歌对它的定位:这是要进企业合规流程的东西,不是一个玩具。

图片

无形水印和身份验证:真正的护城河在这里

安全这部分,谷歌没有偷懒,而我认为这才是整个更新里技术含量最高、也最被低估的一块。

第一层,做个人分身需要一道安全验证,和你真实的谷歌账号绑定。 别人没法在你不知情的情况下造一个你出来。分身是锁在账号上的。

第二层,用这个方式做出来的每一条片子,都带有来自 Google DeepMind 的 SynthID 隐形水印。 任何人都能去检验一条视频是不是 AI 生成的。

把这两层放在一起看,逻辑就出来了:生成能力本身已经不稀缺了,稀缺的是”可信”。

一个谁都能一句话出片的世界里,最值钱的不是出片,是能证明这条片子是谁做的、是不是真人拍的。谷歌在放开生成能力的同一天,把身份验证和溯源水印一起放了进去——这两件事必须同时做,先放生成再补溯源,就晚了。

我的看法是:接下来几年,AI 视频领域真正的竞争壁垒不在画质,在这套身份和溯源体系。画质会迅速拉平,信任不会。

图片

限制说清楚:现在还不是所有人的游戏

必须把限制讲明白,不然容易被带节奏。

上线阶段仅支持英文,仅面向 18 岁及以上用户。 而且,在欧洲经济区、瑞士和英国还不可用。

如果你在这几个地区,现在能做的就是盯着政策变化。这几个地区的缺席不是技术问题,是监管问题——恰恰是对 AI 生成内容和生物特征数据管得最严的几个地方。

这也从侧面印证了上一节的判断:数字分身涉及的是人的脸和声音,属于生物特征范畴。这个功能能走多远,取决于监管而不是模型能力。

至于英文限制,我预计会比地区限制解除得快得多。语音克隆和口型同步的多语言扩展,是纯工程问题。

图片

被忽略的一条:你可以画一张草图给它

回过头再看 Gemini Omni 的输入清单,有一项几乎没人讨论——草图

它能接受的不只是文字和图片,还包括你随手画的草图,以及一段语音录音。官方的说法是,你可以上传一张照片或者一张粗糙的草图,好让 AI 理解你想要的那种感觉。

这一条为什么重要?因为它补上了纯文字描述最大的一个短板。

有些东西是说不清楚的。 镜头怎么摆、人在画面里占多大、光从哪个方向来——这些用文字写要写一长段,而且写完了对方还未必理解对;但随手画三个框、标两个箭头,五秒钟就说明白了。

导演用分镜脚本沟通了一百年,靠的就是这个道理:空间关系用画的,比用说的效率高一个数量级。

所以我判断,真正把这个工具用出水平的人,最后大概率不是靠写出多华丽的提示词,而是靠”随手画一张丑草图 + 一句大白话”这种组合。语音输入同理——把想法说出来,比打字更接近思考的原速。

多模态输入在这里不是一个参数表上的卖点,它是在给”描述能力”这个新门槛铺台阶。既然门槛已经从”会不会做”移到了”说不说得清”,那么能让人更容易说清楚的每一种输入方式,都是在实打实地降低门槛。

图片

我会怎么用它:三个真正划算的场景

抛开概念,说点能落地的。

第一,重复性高、更新频繁的说明类视频。 产品功能更新说明、操作流程演示、内部培训。这类视频的特征是每次改动都很小,但过去每改一次就要完整重录。现在改的是脚本,成本几乎归零。

第二,需要”人味”但不值得真拍的内容。 落地页上那段介绍视频、给新关注者的欢迎视频、投放用的短广告。这类内容有出镜的人会明显好过纯图文,但为它专门布光架机器又不划算。数字分身正好卡在这个空档里。

第三,已有素材的抢救。 这个是我最看重的一条,也是最少人提的。手里那些因为光线、背景、某个小瑕疵而废掉的素材,现在可以用对话把它救回来。存量素材的价值被重新激活了,这比生成新素材更实在。

反过来说,我不建议现在就用它做的:需要真实性背书的内容。客户证言、创始人访谈、任何”我以我本人的身份向你保证”的场景——即便技术上做得出来,一旦被发现是分身,信任的损失远大于省下的那点拍摄成本。

工具的门槛降到地板上之后,稀缺的就不再是执行力,而是判断力——你要清楚地知道自己想要什么,并且能把它说出来。

这一轮变化里,最大的转移是:过去需要一整个团队才能干成的事,现在只需要你给出一句清楚的话。

设备不再是壁垒,剪辑技能不再是壁垒。留下来的壁垒只有两条——你对内容本身的判断,以及你有没有能力用语言精确地描述你要的东西。

现在开始动手测试的人,会在所有人反应过来之前,先搞清楚这东西到底怎么用。这个时间差,就是这次更新给普通人留的最大一块红利。

 

© 版权声明
THE END
喜欢就支持一下吧
点赞14赞赏 分享