为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

一、全文速览图

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

今天,Seedance 2.5 的 API 正式上线了。

我知道几乎所有视频 Agent 产品、还有一些想做大制作广告、中长精品剧的、影视公司内部的系统,都在等这一刻。

接下来大家都会迅速把 Seedance 2.5 接进自己的工作流里,然后开始继续碾压式创作,哪怕是 AI 精品剧、AI 短片,我觉得应该也都会迎来一波质量的跃迁。

但说实话,我其实上周就想写 Seedance 2.5 了,但是在用了一段时间以后,我依然觉得,我自己的能力,完全不足以让我看懂这次更新。

这件事很奇怪。

今年 2 月的时候,Seedance 2.0 刚出来的时候,我几乎只用了一会,就能感受到那种迎面而来的震撼,那一次,我也写了一篇稿子,来描述我对 Seedance 2.0 的理解。

拥有导演思维,15 秒,无可匹敌的调度,精准的多模态可控等等,进步太显眼了。

显眼到冯骥说,AIGC 的童年时代结束了。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

可 2.5 不太一样。

它能原生生成 30 秒,能一次参考 30 张图片、10 段视频和 10 段音频,能做时间戳级编辑,能参考白模,能处理更复杂的长叙事。

参数全都变大了,功能也全都变强了。

可是这段时间,我看到一些人体验完以后说:

为什么感觉 2.5 效果好像没有 2.0 好了?

原来一句话就能出来的东西,现在要写很长的 Prompt 才能得到。

但是又看到很多影视圈的朋友说,2.5 比 2.0 牛逼太多了,质感完全不一样了,上限被拔高了很多倍,一个个都摩拳擦掌想大干一番。

所以这几天,我很想弄清楚几个问题:

Seedance 2.5 到底改变了什么?

为什么一些人觉得升级不明显,而另一波人,比如我的导演朋友,却给出了完全相反的答案?

它所谓的电影感,到底是什么?

最重要的是,2.5 这个模型,在进入整个行业以后,它到底会有什么用处?

我有一些自己的体验,但是我依然觉得,我的视角过于业余和片面,于是,我去找了我的几位好朋友,跟他们也深度聊了聊,做了一些采访,希望搞清楚这些问题。

有 B 站著名的 AI 视频创作者,我心中世界级的大神,@DiDi_OK。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

同样是我心中 TOP 级的 AI 视频创作者@海辛和阿文 、@小文&晓丹,以及一个不太能对外透露姓名的朋友。

在跟他们聊完以后,我想,我终于有了答案。

Seedance 2.5 给我们带来的,是一个完全不同的未来。

于是,我也想写下这篇文章,给大家也看一下我得到的答案。

那接下来,我们开始。

二、为什么有人觉得,Seedance 2.5 反而没有 2.0 好用了?

我在跟大家聊的时候,有一句话我觉得很一针见血。

几乎解释了 2.5 上线以后,所有看起来互相矛盾的评价。

“2.5 的指令遵循太强了,所以,当一个模型 100%听用户诉求的时候,这个模型本身的能力上限,就变成了用户的上限。”

如果我们回头看,Seedance 2.0 当初为啥让大家感觉那么神呢?

如果去掉那些真实的物理、画面的进步之外,有一个很重要的点,也是我之前文章里面写的。

Seedance 2.0,第一次让 AI 视频模型,有了导演思维。

比如当时我们的一个 Case 的 Prompt。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

你无需设计镜头、切镜等等,模型会自己去决定,甚至,他会为了效果,没有那么听你的话。

在模型研究里,这部分可以叫泛化,也可以叫幻觉,但落到普通创作者手里,它就成了创造力。

这是 Seedance 2.0 最讨喜的地方,让无数的普通人,也能一句话,生成一段很好看的视频。

对于普通用户来说,这种主动性确实很爽。

但,对于专业的影视创作者来说,他有的时候真的就会令人抓狂,代表性的特性就是,它的指令遵循没有那么强,经常的自己发挥。

比如你想要一个克制的长镜头,2.0 为了效果,它就非要切镜。

很像是社交媒体上会火的视频,更快的节奏、更密集的信息、更频繁的切镜,特别是模型还会卡点。

这些都是爆款短视频的特点,模型很好地学习了这些能力,形成了 2.0 特别鲜明的特点性格。

2.0 可以生成 15 秒的视频,它也特别会拍 15 秒,因为这个时长,太短视频了,它的很多能力,都是为了让普通人,更好的生产出很具有爆感的视频。

而这一次,到了 Seedance 2.5。

Seed 团队换了目标。

我的不太能透露姓名的朋友告诉我,他们把这一版 SFT 数据的切分方式、描述方式还有质量标准,是完全按照电影生成的方法重新做了一次。

同时,也重新定义了审美的方向,也重做了质量标准。

这一切,都是为了跟电影标准对齐,而不是短视频和短剧。

模型学习的也不再只是“画面里有什么”“镜头怎样移动”这些描述,还包括一个导演会怎样描述自己的意图。

比如:

我希望观众看到这个镜头以后会难过。

我希望这个角色看起来在笑,眼神里却有一点犹豫。

我希望两个人之间的沉默,成为推动剧情的一部分。

这类描述很抽象,它们指向的也不只是一个动作,还包括表演、节奏、构图、光线和声音等等共同制造出的感受。

模型想要理解这些,就必须压住自己随手补戏的冲动,从而把创作者想要的东西执行出来。

对于专业人士来说,可控性和一致性,永远是第一要义。

于是,2.5 主动消灭了一部分刚刚好的幻觉。

它更听话了,指令遵循也变得极强。

但代价也更直接了,当你只给它一句很短、很含糊的话,它不会像 2.0 那样兴高采烈地替你补完整套方案,从而达到一个看着很聪明的效果,它可能真的只完成你说的那一点,于是画面或许就会显得有些木。

就像,从一个天马行空的伙伴,变成了一个可靠但可能没那么有意思的搭档。

海辛的描述我觉得非常的准:

“2.0 对业余创作者更方便,因为模型自己延展镜头的能力很强。2.5 对专业创作者更友好,因为它稳定、可控,愿意服从更具体的导演意图。”

我用一个例子来表现一下,大家可能更好理解。

比如我要做这么个视频。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

这是 2.0 出的效果。

当视频在手机上无法加载,可前往PC查看。

这是 2.5 的。

当视频在手机上无法加载,可前往PC查看。

你会看到,2.0 补了一些镜头,快切非常之猛,并且做了一个很大的运镜调度。

相比之下,2.5 的节奏就更平实,没有那么多的切镜,精准的表达你的 Prompt 需求,并且节奏更加电影感。

这也解释了为什么,把它用好的人,Prompt 会写得越来越像分镜表、导演阐述和拍摄计划之类的东西。

模型变得越听话,那反而对创作者的要求,就越高了。

三、30 秒的意义

Seedance 2.5 这次最显眼的数字,自然就是可以直出 30 秒的视频了。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

2.0 最多 15 秒,这次 2.5 翻了一倍。

乍一看,其实就是多了 15 秒,就是一个普通的生成时长增长了。

可是在叙事中,15 秒和 30 秒的片段之间,其实有着质变。

这也能体现出,Seedance 2.5 目标是极致影视化而诞生的结果。

15 秒来说,通常只能够支撑我们完成一个点子。

比如一个人冲进房间、一辆车穿过城市、一个怪物从水里爬出来之类的。

但如果你想在里面加入铺垫、发展、停顿、转折和结果,那时间立刻就不够用了。

于是模型就只能疯狂切镜,尽可能的在 15 秒之内压缩达到你的要求,于是,这就变成短视频节奏了。

可是,真正的影视不是这样的。

影视需要铺垫,需要时长,需要沉默。

而 30 秒,开始在整体上接近一个完整的场景单元了。

比如两个人可以先说一句话,沉默几秒,出现一个细微的表情变化,然后让某个动作改变关系,最后再给观众一点反应时间。

这几秒钟的停顿,看起来什么都没发生。

可在一场戏里,很多情绪和念想,反而恰恰发生在沉默的几秒钟里。

叙事,很多时候讲究的是留白,是那说不满的一寸。

当视频在手机上无法加载,可前往PC查看。

过去的 AI 视频工作流,本质上是一张图对应几秒动态,再把几十个片段拼成一支片子。

但现在,你要考虑的就是,这三十秒为什么存在,人物在里面发生了什么变化,观众应该在哪一秒知道什么。

这基本已经开始接近导演每天面对的问题了。

四、所谓电影感

这次我问 DiDi_OK,他使用 Seedance 2.5 最直观的感受是什么。

他几乎没有犹豫。

就一个词,美术。

在他看来,美术是 2.5 最重要的升级,甚至比 30 秒、50 个参考素材更重要。

因为很多功能上的问题,可以通过多抽几次、换模型、做剪辑、上后期来补。

可画面底子里的材质、光影、颜色和空间啥的,一旦很差,后面就很难救回来了。

海辛表达的也是如此。

她给我看了几组同一输入下的 2.0 和 2.5 的对比。

她觉得,最明显的差别,就是颜色终于没有那么油了。

这个视频其实就能很明显的看出来,整体颜色都更舒服,饱和度也更克制,AI 味也更弱。

当视频在手机上无法加载,可前往PC查看。

而且人物 AI 脸的部分,也被大幅改善了。

这也是很多人说 2.5 有胶片感、实拍感的来源之一。

但电影感绝不只等于低饱和。

让一个画面显得可信,至少还包括这些东西:

光源方向要一致。

材质面对光线时要有正确反应。

人物皮肤、眼睛、毛孔和衣服的纹理,要随着距离和角度自然变化。

声音也要知道远近、遮挡和空间等等。

DiDi_OK 提到一个特别有意思的细节。

2.0 即使把分辨率拉高,人物边缘有时依然会出现一条很硬的线,手看上去只是一个模糊的面,环境又是另一个面,两者之间泾渭分明。

到了 2.5,即使观看的是 720P 的较低分辨率结果,手背不同斜面的阴影、皮肤细节的暗示、人物和环境之间的光线过渡也更丰富,边缘不再那么硬,主体才终于像真的站在那个空间里面了。

当视频在手机上无法加载,可前往PC查看。

这也是为什么,有些专业创作者会觉得 2.5 的 720P,看起来比过去更高分辨率的结果还舒服的原因。

Seed 的朋友也举了一个例子。

你对 2.0 说,一个女生站在头顶的射灯下面。

它会生成一盏射灯,也会把女生放到灯下面。

从物体清单来看,它完成了指令。

可那盏灯的光,可能根本没有落到女生脸上。

2.5 会继续理解后面的因果关系:既然灯在这里亮着,人物的额头、鼻梁、眼窝、肩膀和地面就应该怎样受光,影子又应该落到哪里。

这种进步你很难用一些片段来描述,甚至很多人其实也说不出来个啥,但是就会感觉,哎这一版好像更舒服一点,那一版好像假一点。

可电影感,很多时候就是被无数个这种说不清的小地方,托举起来的。

五、空间与声音

这次还有两个最容易被大家低估的升级,是空间和声音。

DiDi_OK 说,2.0 时代大家特别爱做快速打斗、快速运镜和疯狂切镜,还有一个现实原因。

那就是空间关系不好控制。

模型很难通过一张图持续理解角色站在哪里,门在哪里,摄影机又在哪里。所以镜头停得越久,观众越容易发现透视不对、人物漂移、背景变了值之类的穿帮。

快速切镜刚好可以把这些问题藏起来。

看起来很燃,但有时也是没办法。

2.5 对空间的理解明显变强以后,创作者不需要再用那么多切镜去藏拙了。

一个角色可以在同一空间里连续运动,摄影机换一个角度,模型依然大致知道人物、道具和场景之间是什么关系。

这会给叙事带来非常直接的变化。

只有空间稳定,演员才有地方表演。

只有镜头愿意停下来,观众才有时间看见表情。

只有人物在空间里的位置可信,走近、远离、回头、躲避这些动作才会产生意义。

当视频在手机上无法加载,可前往PC查看。

声音也是同样的道理。

DiDi_OK 以前会专门留出时间和预算,为 AI 视频重新做音效。

2.0 的人声已经很好,角色声音一致性也很强,但它经常会漏掉那些看起来不重要的声音。

比如一个人坐在远处动了一下,或者筷子碰到碗这种,经常都会没有声音。

比如角色拿起一把金属武器,只有对白,没有影视里为了强调重量和机械结构而设计的金属摩擦。

画面动作发生了,可是声音却没有跟上。

2.5 在这方面细腻了很多。

碰撞的声音,人体接触物体时很轻的摩擦,抽象生物和机械装置应该发出什么声音,模型都会主动补得更完整。

当视频在手机上无法加载,可前往PC查看。

所以这次,空间感的进步和声音的进步,其实是很多人所忽略的。

当然,它依然有明显问题。

比如 DiDi_OK 测试时发现,云、烟雾、远处篝火的烟,有时会像壁纸一样挂在天空里,空气流动和环境之间缺少关系,控制物体一多,模型也可能顾住第一件事,漏掉后面的要求。

比如第一人称 POV 镜头依然容易暴露 AI 感,真实摄影机里的呼吸、变焦、步伐带来的细碎震动和临场感,还不够灵动。

中文对白有时也会带着一种播音腔,很多聪明的创作者会用方言绕开,因为我们对普通话太熟了,一点点不自然都会被放大。

所以,Seedance 2.5 其实也还没有达到随便生成就是影视的地步。

复杂场景依然需要抽卡、调试、后期和人的判断。

六、Seedance 2.5 到底有什么用?

聊到这里,终于可以谈最敏感的问题了。

这个全新的模型,他到底有什么用呢?

首先大家最关心的,肯定就是如此影视级的 Seedance 2.5,会不会让部分的影视从业者感受到危机?

坦诚的讲,我想说,会。

冲击会沿着任务一层一层传导,先从价格最敏感、交付周期最短、容错率相对更高的地方开始。

比如,广告、电商、MV、宣传片、短视频和短剧里的大量中低成本镜头。

这些其实我们已经能看到大量的 AI 运用和替代了。

而对真正的大电影、大剧集来说,AI 最快进入核心流程的地方,还不是最终画面。

但概念测试、动态分镜、整片 Animatic、场景预演、动作预演、光线测试、提案片和样片,都可能会被迅速改写。

而且 Seedance 2.5 支持白模参考,这件事尤其重要。

为什么专业导演说Seedance 2.5比2.0强太多,普通人却嫌退步?

一个剧组可以先在简单的 3D 空间里摆好立方体、圆柱、人物位置和运动路径,再让模型根据这些空间信息,快速生成接近最终视觉效果的预演。

过去我们在组里拍预演,即使是全部用 3D 动捕小人,那个成本依然贵。

现在,静态白模加 Seedance 2.5 就可能把这些往前推进很多。

但是如果我们只看影视行业,我觉得一切还是太窄了。

其实在我这次聊下来,还有一个很重要的领域,是常常被我们所忽略掉的。

那就是具身智能。

具身这个行业过去一直有一个痛点,就是太缺数据了。

机器人要真正走进工厂和家庭,需要见过大量的物体、动作、环境,以及各种人类想都想不到的意外。

可这些数据,对机器来说,每一条都很贵。

以前当然我们也可以在 3D 仿真环境里造这些数据。

Seedance 2.5 因为能力的跃迁,又提供了一条新的路径。

开发者可以先用白模规定机械臂、目标物体、障碍物和运动路径,再用图片规定材质和环境,用 Prompt 补充事件。

三十秒的长度,可以覆盖一段相对完整的操作过程。

局部编辑又可以在尽量保持其他条件不变的情况下,只改一个物体、一个动作,或者某几秒里发生的意外。

这个的想象空间,可能比做影视还要大,甚至,疯狂加速具身的落地。

这可能才是 Seedance 2.5 真正大的产业变化。

七、未来最值钱的能力

当最终的一切,越来越便宜,昂贵的东西会逐渐往上游移动,我觉得未来,最重要的可能就是几个能力了。

第一,是判断。

模型一小时可以给你几十个镜头。

哪一个对,哪一个只有表面好看,哪一个能接住上一场戏,哪一个会破坏人物,依然需要人做决定。

所以,有审美、有叙事能力的导演、美术指导、摄影指导、剪辑师、声音设计师和视效总监,价值只会越来越贵。

第二,是可以被模型使用的资产。

因为 Seedance 2.5 的 50 个素材的超强参考能力,未来,角色的多角度设定、表情库、服装、道具、场景、声音、动作、镜头规则、色彩规范,都会从参考资料变成生产资料。

这些,是一致性和可控性的基石。

不仅对影视创作很重要,对具身数据生产,也很重要。

第三,是故事。

当所有人都能做出看起来像电影的画面,电影感会迅速贬值。

今天一段逼真的 AI 视频还能靠“这居然是 AI 做的”获得传播。

再过一段时间,观众一定会疲劳,一定会逐渐钝感。

那时候,大家只会在乎一件事,就是你的故事,它好不好看。

模型吃过大量优秀影像,它能学到构图、运镜、光影和节奏的平均规律。它也会把这种平均规律分发给每一个人。

结果可能很残酷。

大家的画面都更高级了,也更像了。

最稀缺的,会变成别人没有讲过的经验、人物和情感。

一个好的故事,依然是最重要的。

也依然,需要从生活里来。

八、写在最后

写到这里,我终于能回答,Seedance 2.5 相比 2.0,到底改变了什么了。

2.0 的震撼,来自 AI 突然学会了很多导演才会的东西。

而 2.5 的变化则更隐蔽。

它开始学会收住自己的表演,理解更细的创作意图,在更长时间里保持空间、角色、光影、声音和节奏,然后把控制权,交还给创作者。

这种变化,更深、更细、却对行业的改变,更加潜移默化。

所以,在今天,我们可能每个人都得思考一个最难的问题:

当你有了 Seedance、有了 Codex、有了各种各样几乎能让你无所不能的工具,那你,到底想对世界讲述什么呢?

我们每个人。

可能都需要自己的答案。

收藏
点赞 23

复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。