万字干货!手把手教你搭建多模态模型评测体系(一)

一、全文速览图

万字干货!手把手教你搭建多模态模型评测体系(一)

现在不管是个人开发者,还是公司,AI 被接进的产品和流程越来越多,但评测反而越来越容易被跳过。

模型迭代越来越快,很多团队的评测正在被压缩成临时抽查。

个人开发者跑出几条看起来不错的结果,可能就开始往产品里接。

而在公司,模型迭代得太快,能力越来越强,生成质量也越来越高,评测体系反而很难再按部就班地往下做。

旧标准还没来得及升级,新版本又出来了。最后往往是先看 Demo,再临时补几道题,凭几个人的体感做决定。在我接触过的一些项目里,模型评测有时候真的很像个草台班子。

因为现在的模型再差,第一眼看起来也差不到哪里去。它偶尔生成一条好结果很容易,真正难的是能不能重复,边界在哪里,换一个版本以后怎么比较,接进产品后能不能稳定交付。个人和公司不是完全不测,而是很少把这些东西当成一套需要长期维护的体系。

公司里到底应该怎么做?

一套能复测、能比较、能进入生产决策的模型评测流程,应该怎么搭?

这也是我想把这个系列写下来的原因。第一篇先讲 Video Model:一套视频模型 Benchmark,拿什么题测,用什么指标看,用什么标准判,以及用什么方法保证下一次还能原样复测。

二、评测前,先明确目标

我当时在公司接到的第一个需求,是做一个产品宣传 Agent。第一步不是写提示词,而是选模型。

模型不一定越新越好,也不一定越贵越好。最终要看它是否适合业务场景,以及质量、成本和抽卡率能不能接受。

如果模型还没定,就先拉候选池做横向选型;如果公司已有合作厂商或既定模型,就做单模型评测。进入 Benchmark 之前,先分清这两种目标。

1. 横向选型

横向选型不是把市场上所有视频模型都测一遍。成本和周期都不允许,任务也不会等,所以第一步是先拉候选池。

可以先看公开实测、行业口碑和每个模型擅长的方向,把明显不适合当前任务的排除掉,再把真正有比较价值的几个模型放在一起横向比对。

候选池的第一轮筛选很大程度上还是靠经验:哪些模型通常在第一梯队,哪些在某个方向特别突出,我会先把它们拉进来,再用同一套题验证这种判断。

万字干货!手把手教你搭建多模态模型评测体系(一)

进入候选池以后,我准备了多个场景的视频生成提示词,在同一个评测维度下让不同模型跑相同的一套题。当时我定了五个评测维度:提示词遵循、时序连贯性、内容多样性、物理规律符合度和画面质量。

万字干货!手把手教你搭建多模态模型评测体系(一)

这是我早期的一个评测文档,现在回过头来看,评测标准相对比较片面。

当时只是用了一个 1~5 分量表,每一分具体代表什么、不同人应该怎样对齐,我都没有写清楚,基本还是凭个人感受给视频打分。

包括评测报告里的几句点评,现在看也写得很随意。  比如有一条二哈的视频,我写的是:“到最后才看到狗头,一直跟拍二哈的屁股,不知道出于什么考虑。”

万字干货!手把手教你搭建多模态模型评测体系(一)

哈哈,这就是我当时写下来的点评。还有一次拿通义万象文生视频测图书馆,如果不是右下角两个人在动,我还真以为它是一张图片。

万字干货!手把手教你搭建多模态模型评测体系(一)

这是我还没有形成一套稳定评测流程时,自己边测、边摸索留下来的文档。

这次横向选型最终得到的,不只是一个笼统总分,而是在四类任务场景里,用同一套五项指标比较哪些模型更适合我们的业务。

当然,结论必须建立在同一套题、同一条件和同一套标准上。

万字干货!手把手教你搭建多模态模型评测体系(一)

2. 单模型评测

另一种情况,是模型已经选定。这时评测要回答的,不是“它比谁强”,而是“它能不能用,边界在哪里”。

单模型评测常见于三种情况:个人已经看中某个模型,想判断它是否过线;公司已有合作厂商,要做上线验收;模型已经接进产品,需要验证它能否长期承接某类任务。

模型生成本身是个黑盒。评测不能把黑盒直接变得可控,但可以让风险变得可识别、可约束、可回归。

比如搭一套 CMS 内容生成系统,选题、资料、提纲和素材都在前面准备好了,最后交给模型生成成品。只要这一步出错,整个流程就无法稳定交付。

所以首先质量要过线。过线以后,还要看同类任务反复运行时,能不能持续达到这条线。

旧版本、当前生产方案或者人工流程都可以作为基线。只是这时候比较的目的,是判断这个模型有没有达到自己的使用标准。

这次 Seedance 2.5 测试,主要覆盖叙事与编辑相关任务。

这类内容里,单个镜头好看还不够。人物、声音、动作和镜头要接得上,多个人和多份参考素材不能乱,视频延长后剧情还要继续,局部编辑和风格迁移也得真的能进入下一步制作。

因此,这轮结果要回答的是:2.5 相比 2.0 到底变在哪里,哪些输出已经能用,哪些还需要重试或者人工修补,为了拿到可用结果,继续按生成按钮到底值不值。

文生视频、图生视频、首尾帧生成、多人参考、镜头控制、视频延长、局部编辑和风格迁移,虽然都叫视频模型能力,但它们要求的输入和验收方式并不一样。要比较哪一种任务,先定下来,再去定义评分标准。

目标也会决定达标线和测试规模。个人摸底,重点是尽快发现长处和短板;进入正式生产,则要把稳定性、成本和人工修补一起放进评测标准。

三、怎么搭一套 Video Model Benchmark

不管是横向选型还是单模型评测,只要每次换模型都临时出题、临时改标准,测完的结果就留不下来。要让下一次还能原样复测,就需要把这次判断固定成一套 Benchmark。

一套 Benchmark 的核心不是“多测几条”,而是固定四件事:评测集决定拿什么题测,评测指标决定看什么,评测标准决定什么算过线,评测方法决定题具体怎么跑。它最终要产出的是能够复测、能够比较的结论,而不是一句“我觉得还行”。

1. 评测范围

在这套业务评测里,我先把问题分成三类:内容、功能和性能。

内容评测看生成结果对不对、好不好;

功能评测看指令、格式和工具调用有没有完成;

性能评测看速度、并发和稳定性。

视频生成评测通常以内容评测为主,同时也会碰到功能和性能问题,例如指定时长有没有完成、一次生成要等多久、同一道题能不能稳定得到结果。

这四件事构成 Benchmark 的主体。目标和任务范围是它的前提,BadCase、评测报告和下一次同题复测,则是它真正进入生产后的维护方式。
后面的 Seedance 2.5 实测,会用八组真实 Case 跑一遍这套框架。

2. 评测集

评测集就是实际拿给模型做的那组题。它不是把一堆看起来很难的提示词放在一起,而是用一组题代表真正想判断的任务。

评测集构成:线上用户的真实输入、产品或者模型历史留下的 BadCase、业务方真正要做的任务,以及新版本更新项、官方能力说明和公开 Benchmark。

AI 可以帮忙补题、生成难度不同的变体,也可以先按简单、中等、困难给题目分层。但提示词是否真实、题目是不是在测目标能力、参考答案和过线标准是否合理,最后都要由人来审核。

放回这次 Seedance 2.5 的八组实测里,我按照每道题主要验证的能力,把它们分成内容理解、视听表演、时序连续、多人一致、编辑与风格五类。

之所以先分大类,是因为同一类题应该共用一组指标和过线标准。这样下一次换成 Seedance 的新版本,或者换一款视频模型,比较的仍然是同一种能力,而不是八次互不相关的体验。

万字干货!手把手教你搭建多模态模型评测体系(一)

同一套评测集里,还要同时放基础题和压力题。基础题看模型能不能稳定、直接、低成本地完成常见任务;压力题故意增加人物、素材、方向、方言或者风格等约束,观察复杂度上来以后,它会先在哪里出问题。

评测集一旦确定,在一段时间内就别随便换。旧版本跑一套题,新版本又换另一套,哪怕新版本分数更高,也很难判断提升来自模型,还是来自题变简单了。固定题目的价值,就是把题目本身变成控制变量。

当然,前提是比较的还是同一种任务,同一组题。

判断一套题是不是 Benchmark,最关键的标准是:换成 Seedance 的下一个版本,或者另一款视频模型,这套题仍然可以原样再跑,并得到可比较的结果。

3. 评测指标

有了评测集,下一步是先写清每道题到底看什么。指标负责描述观察维度,例如主体一致性、动作完成度、物理合理性和生产可用性;至于多少分算过线、什么错误必须一票否决,留到下一节的评测标准里定义。

每个 Case 都可以先把提示词拆成细分要求。比如主体有没有出现、人物数量是否正确、指定动作是否发生、空间关系和方向是否执行、台词和场景是否符合要求、文字和道具是否存在。能直接检查的要求,先一项项写出来。

同一道题至少要分两层看。

第一层看提示词里明确要求的东西有没有做到,比如人物数量对不对、动作有没有发生、方向顺序有没有执行、道具有没有完成替换。

第二层再看完成得怎么样,比如人物有没有串、动作自不自然、声音和表演能不能配合、风格有没有真正融进去、结果能不能拿去用。

每道题可以从五个维度来判断:显式任务完成、内容理解与一致性、动作与时序连续、视听与风格完成,以及生产可用性。

万字干货!手把手教你搭建多模态模型评测体系(一)

具体任务不同,五个维度的侧重点也不同。

比如道具替换更看重目标有没有替换、非目标有没有保住;

方言测试更看重台词可懂度、情绪、环境声和人物反应;

视频延长则要重点看人物、画面、剧情和接缝。

先从任务出发,再选择真正能决定结果是否可用的指标。

4. 评测标准

过线标准也要在看结果之前定。烟斗 Case 里,如果题目只要求替换烟斗,打火机被保留就不能事后算成违反指令。想把关联道具一起变化作为判分项,必须先把它写进题目。否则评测的人很容易根据自己看到的结果,临时移动那条及格线。

不同问题,要用不同的判断方法。

人物数量、视频时长、左右顺序、指定动作和道具有没有出现,这些有客观答案,用二值判断就够了:做到或者没做到。它适合守住最明确的底线,不需要为了看起来精细,再人为分出几个模糊档位。

同一道题比较两个版本,可以用 GSB,也就是 Good Same Bad。新版本更好,记 Good;差不多,记 Same;更差,记 Bad。两边必须使用同一类输入、相近参数和同一套验收标准,不然比较的是题目和条件,不只是模型。

画面、表演、风格、物理合理性和生产可用性很难只有对错,通常要用主观质量量表。可以采用 1~5 分,也可以采用 0/1/2 三级量表,后者分别对应不满足、部分满足和满足。需要报告 MOS 时,应由多名评测者独立评分,再对同一量表的结果取平均,并把评分条件和样本口径写清楚。

评测标准里的每一个分值,都要有能直接对照的 Good Case 和 Bad Case。

比如我这份测评表使用的是 1~5 分主观量表。

1~5 分里的每一分,都要对应一种能直接看懂的完成程度。

1 分是核心任务失败、整体不可用。

2 分是只完成一部分核心要求,需要重做。

3 分是核心要求完成,但必须修补。

4 分是核心要求完整,少量问题可以修。

5 分是完整满足,还出现了符合场景的合理细节。

万字干货!手把手教你搭建多模态模型评测体系(一)

这些 Case 就是评分锚点。评测的人看到 3 分,不是凭感觉理解成“中等”,而是知道它对应哪种完成程度、需要多少修补。图里的例子用来解释每个档位大致是什么样。

客观红线要先于加权总分。人物数量、方向、动作、时长等明确要求没有做到,就算其他维度把平均分拉高,这条结果也不能判作可用。

红线通过以后,再算单个 Case 的综合分。五个维度分别按 1~5 分判断,计算方式是:

Case 综合分 = 显式任务完成×25% + 内容理解与一致性×25% + 动作与时序连续×20% + 视听与风格完成×15% + 生产可用性×15%

比如五个维度依次是 5、4、3、2、1 分,那么:

5×25% + 4×25% + 3×20% + 2×15% + 1×15% = 3.30 分

这个分数的作用,是在同一道题、同一套权重下比较版本变化。它不能把完全不同的任务强行压成一个看起来准确的总排名。

5. 评测执行

评测集、指标和标准定下来,还要把题具体怎么跑写清楚。生成次数、选片方式、重试、参数和预算只要有一项不一样,同一道题也可能得到完全不同的结论。

万字干货!手把手教你搭建多模态模型评测体系(一)

生成次数、选片与重试

同样的提示词重复生成,结果可能不一样。评测开始前要先定好:每道题生成几次,最后看第一次结果、随机抽取的结果,还是几次里最好的一次。

这三种选法回答的问题不同。第一次结果更接近日常使用时按一下就能拿到什么;随机抽取可以减少人为挑片;几次里最好的一次更接近模型在当前条件下能达到的上限。三种都可以用,但不能旧版本看第一次,新版本却只挑最好的一次。

重试也要提前写规则。什么情况下允许重试,每道题最多重试几次,提示词能不能改,输入素材能不能换,都要在看结果之前确定。否则表现不好的版本不断补抽,表现好的版本只算一次,最后得到的不是模型差异,而是耐心和预算差异。

同一组版本对比,尽量使用相同输入、相同平台、相同分辨率和时长,以及相同的预算、重试规则、选片方式和验收标准。做不到完全一致时,就把差异写清楚,不把不能直接比较的结果硬塞进同一张排名里。

要测多少条,没有一个放到哪里都一样的答案。下面是我按用途做预算时使用的起始规模,只是规划参考,不是统计学阈值:

  1. 5~10 条,先做个人摸底,看看模型大概强在哪里、短板在哪里;
  2. 10~20 条,拿来试标,让两个人独立打分,再对齐标准;
  3. 50~100 条,针对一个维度做比较正式的测试;
  4. 200~500 条,才更接近工程化的整体评测。

这些数量只用于规划第一轮工作量。样本是否够,要看任务分布、结果波动、错误代价和评测者一致性,不是跑到第 50 条,结论就会自动变得科学。一次偶然生成得很好,只能说明模型这一次做到了;同样规则下反复生成仍能交出可用结果,才说明它开始具备稳定性。

当目标是进入生产时,稳定性比单独一次高分更重要。

6. BadCase 与成本记录

BadCase

BadCase 也不能只截一张失败画面就结束了。视频多了时间维度,需要保留原始输入和原始输出、问题出现的时间区间、问题前后的关键帧或者短片段,再记上问题标签、严重程度、是否重复出现、重试次数、单次价格和后期修补量。

一张截图只能说明某一帧发生了什么。闪烁、身份漂移、速度突变、动作不连续、接触关系跳动,往往要看问题出现前、出现时和出现后的连续变化,才能判断它是偶发的一帧,还是已经影响整段视频。

问题标签可以按指令遵循、时序一致性、动作与物理、画面质量、镜头与构图、视听与风格、生产可用性来归类。标签不是为了给失败起个名字,而是为了让算法和产品看到:同一种问题出现了多少次,具体落在哪些 Case 里。

成本

视频能生成出来,不等于能进入生产。为了拿到一条可用结果,要花多少生成费,要不要重试,要筛掉多少条,还需要多少后期修补,这些都属于评测结果。

在我测试时,成本一开始并不是重点关注项;但随着测试不断加深、每条都要多次生成,我逐渐发现成本不仅是预算问题,也会直接限制你敢不敢复测。

同一个页面里,4K、15 秒一次已经超过 100 元。这个价格可能随时变动,只作为参考。

前面的延长 24 元、多人测试 48 元、风格迁移 56 元,对应的任务和时长不同,不能直接横向比较。它们要和各自的结果放在一起看:这次生成能不能用,还要不要再抽一次,后面要花多少时间去筛选和修补。

这些单次价格,最后都会落到普通创作者一个很具体的选择上:是先花几万元买一台相机,还是先按十几次生成按钮,把想法做出来?

但真正算账时,不能只比设备价格和单次生成价格。相机可以反复使用,真人拍摄还有人员、设备和场地成本;AI 视频也有生成、重试、筛选、修补和返工成本。真正要比的,是完成同一个交付任务,两种方式分别花了多少总投入。

7. AI 与人工

评测里有一部分工作适合交给 AI。比如把提示词拆成细分要求、补充难度不同的变体、批量检查视频时长和人物数量、给问题做初步标签,再把同类结果聚合起来。

答案客观、口径统一的部分,也适合让 AI 或程序先做初筛,比如人物是否出现、数量是否正确、视频时长是否达标、输出格式是否符合要求。但自动评测本身也要先用人工标注的样本校准,复杂视频不能把模型判断直接当成最终答案。

但审美、人物表演、风格融合、物理合理性,以及那些模型自己也说不准的高风险样本,还是要交给人。如果把所有视频都交给一个模型自动判完,很容易漏掉表演是不是自然、风格有没有融合、物理逻辑会不会穿帮。

人工和自动化不是二选一。机器先处理明确、重复、可以统一口径的部分,人再复核主观质量、低置信度和高风险样本,效率和判断质量才能同时保住。

8. 评测周期

评测体系真正的价值,在于可复用。

新模型或者新版本出来,先跑固定题集。上一轮反复出现的 BadCase 继续留在里面,看旧问题有没有修掉;新版本增加了新的能力,再补增量题。核心固定题不能因为新版本表现不好就随意替换。

输入、平台、参数、预算、生成次数、选片方式和重试规则尽量保持一致。这样比较出来的变化,才更接近模型本身,而不是测试条件变了。

同题复测还会慢慢校准评分标准。哪种结果过去被认为能用,后来为什么需要重做;哪个标签总是落在同一类任务上;一次高分能不能在多次生成里保持,这些都会让下一轮评测更准确。

前面的任务、评测集、考点和过线标准确定后,还要把下面几项写清楚:

  1. 生成次数:每道题统一生成几次;
  2. 选片规则:看第一次、随机结果,还是几次里最好的一次;
  3. 重试规则:什么时候允许重试,最多重试几次;
  4. BadCase:原始输入、原始输出、问题时间段和标签怎样保存;
  5. 成本:单次价格、重试、筛选和后期修补怎样记录;
  6. 复测周期:什么时候跑固定题,什么时候增加新题。

Seedance 2.5 让这套方法有了八组真实样本。下一款模型出现时,不需要再从几条官方 Demo 和一次偶然的好结果重新判断,拿出同一套题,按同一套规则再跑一遍就知道了。

9. 评测报告

最后的评测报告,也不该只有一个总分。更有用的是每个场景的 1~5 分分布、同题对比的 Good Same Bad 原始计数、问题标签出现次数,以及每类问题对应的代表性 BadCase。再把具体题目、新旧版本变化、优化建议和暂时不能归因的问题放在一起,数字才能回到真正可以修的地方。

单个样本出现一次身份漂移,可以写“这条样本出现了身份漂移”;同一种问题在相同条件下多次复现,才适合继续讨论它是不是模型的稳定短板。报告不只是给出结论,也要让人能从结论回到原始 Case。

四、Seedance 2.5 实测

字节 Seed 的官方页面确认了单段 30 秒和两次视频延长;Dreamina 的产品页当时写的是 4K 输出和最多 50 份多模态参考。不同入口开放的能力并不完全一样,所以这里把模型能力、平台能力和我实际使用的入口分开记录。

但我最想知道的不是这些参数:它只是更清晰、更长、更贵,还是它真的变聪明了?

这次实测以内容评测为主,覆盖低模参考优化、物体结构理解、方言、视频延长、多人白模替换、人物服饰融合、道具替换和风格迁移。这里既有常见任务,也有约束一多就容易出问题的压力题。有的结果出乎预期,有的出乎价格预期:按一下几十块,最后还不能用。

这八组测试先作为 Benchmark V1 的试标,用来校准题目、指标和过线标准。涉及版本对比时,只比较输入、参数和验收条件能够对齐的样本;单条样本只说明这次发生了什么,不外推成稳定性结论。正式复测前,还要补齐每道题的生成次数、选片方式和重试规则。

1. 低模参考优化

低模参考优化,先看原素材有没有保住,再看画面、声音和氛围是否补得完整。

2.5 做视频优化时,不只是把边缘拉锐、把对比度调高。它会补物体表面的反光、人物毛发的层次、皮肤和环境光的关系,以及背景和主体之间的空气感。

以前有些 AI 视频很清晰,但你一眼还是觉得“塑料”。这次有些画面不是单纯更清楚,而是更经得起看了。

文字我也单独试了。书本和闹钟表盘上的数字,即使没有在提示词里把具体内容写死,这几条样本也没有出现明显的排序和字体错乱。

接着,我拿了一段质量很低、甚至有点抽象的鬼畜低模视频,让 Seedance 2.0 和 2.5 按照同一类要求去优化。其中一组,我让它根据一段简单模型视频生成《泰坦尼克号》的感觉。

这道题第一层要看的是,原来的人物、动作和镜头关系有没有保住。第二层才看场景、运镜、音乐和氛围有没有补完整,最后出来的是一段完整视频,还是只在原素材上套了一层电影滤镜。

2.0 能完成基本画面和背景音乐。但放在一起对比,2.5 从背景音乐、运镜、环境氛围到电影质感,都更完整。它知道什么时候该拉远,什么时候该靠近人物,音乐和环境声应该怎样托住情绪。

在这一条样本里,2.5 更能接住原素材想表达的东西。

万字干货!手把手教你搭建多模态模型评测体系(一)

Seedance 2.0

万字干货!手把手教你搭建多模态模型评测体系(一)

Seedance 2.5

2. 物体结构理解

我给模型的任务很简单:闹钟响了,人物把闹钟砸掉。

第一层只看砸闹钟的动作有没有完成,2.0 和 2.5 都能交卷。第二层要继续看,闹钟被砸开以后是不是还像同一个物体,里面的结构和碎裂结果是否合理。

2.0 的背景音乐还可以,动作也完成了。但闹钟裂开的那一下,里面的零件更像一团为了“看起来复杂”而拼出来的东西。

当前这个样本里,2.5 的画面更清楚,碎裂后的细节也更合理。闹钟被砸坏以后,里面出现的结构更接近这个物体应该有的样子。

这个结果只能说明,在这一道题里,2.5 对物体前后变化的处理更合理。它不能直接证明模型已经普遍理解了现实世界的物理规律。

万字干货!手把手教你搭建多模态模型评测体系(一)

Seedance 2.0   720p  5 秒

万字干货!手把手教你搭建多模态模型评测体系(一)

Seedance 2.5     720p   5 秒

3. 方言与表演

这一题,我测的是方言、情绪、环境声和人物动作能不能同时成立。

Dreamina 的产品页列出了中文、英语、西班牙语等 11 种主要语言。我看到这里时,旁边刚好坐着一个潮汕朋友。他也让我试试,我就顺手测了潮汕话这个小语种。

这个建议其实挺狠的。潮汕话本身就很难,别说外地人了,有时候不同地方、甚至隔着几个村,发音和习惯都会不太一样。官方也没有单独承诺支持潮汕话,刚好可以拿来做一道压力题。

我设定的场景是在海边一个很嘈杂的大排档。两个人物即将发生冲突,旁边还有其他人。

第一层看的是,人物有没有按要求说方言,场景和冲突关系有没有成立。第二层再看方言的核心内容能不能听懂,会不会明显滑向普通话,人物的停顿和情绪是否自然,环境声会不会盖住对白,以及旁边的人有没有对冲突作出反应。

在这组样本里,2.0 和 2.5 的差距主要出现在整段表演。

2.5 里人物说话时的停顿、语气起伏、动作和台词之间的配合,都比 2.0 自然。声音不是平平地把一句话念完,而是有情绪高涨、有停顿,也有潮汕人讲话时比较鲜明的节奏。

环境声也更像真的。人声、海边的声音和餐桌周围的杂音没有像后期随便贴上去的一层音效,人物对白也没有从背景里硬生生凸出来。

更有意思的是,两个人物马上要发生冲突时,旁边另一个人会在一个恰到好处的时机,微妙地看向其中一个人。那个眼神很短,表情也不夸张,但它刚好让你知道:这个人已经感觉到气氛不对了。

这种东西不是“人物动起来”就够了。它需要模型处理三个人之间的关系、冲突发生的时机,以及观众应该在什么时候看到这个反应。

2.0 那条潮汕话,讲着讲着就开始飙“潮普”了,普通话和潮汕话混在一起,一下子就很容易穿帮,哈哈哈。

视频生成下来,他就在旁边听了一遍,反馈是大概 90% 都能听懂。

这不是模型的方言准确率,只是一个潮汕朋友对这一条视频最直接的反馈。但放回这道题里,它至少说明这条样本的核心内容基本可懂。

也是在这一组测试里,我第一次特别强烈地感觉到:它不只是让人物开口、动起来,还把冲突中的人物关系做出来了。

会做运镜只是一层。这条输出更让我在意的,是它生成出了更符合冲突节奏的停顿、动作和旁观者反应。

当视频在手机上无法加载,可前往PC查看。

Seedance2.0  720p 15s 成本:18¥

当视频在手机上无法加载,可前往PC查看。

Seedance2.5  720p 15s成本:28¥

4. 视频延长

看到 Seedance 2.5 支持视频延长,我也刚好试了一下这个功能。

字节 Seed 的官方页面写得很明确:2.5 单段视频最长 30 秒,并支持两次视频延长。2.0 单段最长是 15 秒。

15 秒更像一个镜头,30 秒已经可以放进人物关系、动作发展、对白和一个小转折。时长一拉长,模型就要承担一个更完整的叙事单元。

延长按钮能点,不代表这项能力过关。第一层看的是视频有没有延长到要求的时长。第二层要看人物还是不是原来的人,画面风格有没有跳,剧情是不是沿着前面的逻辑继续走,延长前后的接缝会不会让人一眼看出来。

这次生成的样本里,延长后的画面一致性和人物一致性保持得还不错。但一条样本只能说明这次结果过了线,还不能证明模型已经能稳定处理长叙事。

成本也要和结果放在一起。我当时点了一下 5 秒的视频延长的生成按钮,页面扣了 24 块。

肉疼也是真的。

万字干货!手把手教你搭建多模态模型评测体系(一)

2.5 视频延长 720P 15 秒 成本 24¥

5. 多人白模替换

多人白模替换,重点看人数、身份和人物关系能不能一一对应。

Dreamina 官方确认的是最多 50 份多模态参考。至于具体类型,我测试时的 RunningHub 页面显示为最多 30 张图片、10 段视频和 10 段音频;这是当时这个入口的页面口径。

理论上,你可以把人物、服装、场景、动作、运镜和声音都交给模型。做得更复杂一点,还可以先在 Blender、Maya 里做简单白模和动作,把人物站位、镜头和节奏定下来,再让视频模型完成人物、材质和场景。

但能塞进去多少素材,和模型能不能稳定处理这些素材,是两件事。

我做过一组多人白模替换:白模里有 9 个人,我再上传 9 个人物参考,让模型把这些角色替换成穿苗族服饰的人物。

这道题第一层看人物数量和替换动作有没有完成。

第二层重点看三件事:人物能不能一一对应,原来的人物关系能不能保住,切镜以后同一个人会不会重复出现。

其中一次是 720P、22 秒,花了 48 元。这个样本里,9 个人的替换效果比较好,人物关系也大体保住了。

但当人物继续增加到十几人、二十人,或者参考人物数量和白模人数对不上时,重复人物就开始出现。有时候一个人切完镜头以后,又会在同一个画面里冒出来一次。

所以“9 人接住了”只能说明这次样本做得不错,还不能证明模型能稳定处理 9 人,也不能把 9 人当成上限。

我还顺手测了一下 Seedance 2.5 的视频编辑能力:让它把原视频里的人物减少到 4 个,同时保持整体和原视频一致。模型准确接住了这个指令,被去掉的人干净地从画面里消失,剩下的人物、背景和运镜都对得上。

它可以直接承接以前需要逐帧抠图才能完成的后期需求,像我们之前在网上看到的那种明星综艺临时"消失一个人"的场景,现在能一步到位。

当视频在手机上无法加载,可前往PC查看。

Seedance 2.5    多人图像+裸模动画参考

当视频在手机上无法加载,可前往PC查看。

Seedance 2.5      720p    22s  成本:¥48

万字干货!手把手教你搭建多模态模型评测体系(一)

【视频编辑功能,人物减少为四个】Seedance 2.5视频编辑减少人物要求

6. 服饰融合与方向顺序

多人一致不只看人数,还要看人物、素材和位置能不能一一对应。

这组 5 人测试,分别给 Seedance 2.0 和 2.5 五个人物图,再给五个人各自需要融合的服装、头饰、帽子、头盔和发型,同时要求人物从左到右依次入座。

第一层看五个人有没有出现、五套服饰有没有匹配,以及“从左到右依次入座”有没有执行。第二层再看人物和服饰能不能稳定绑定,方向词是不是真的理解了,空间顺序在动作过程中会不会乱。

2.0 在服装、发饰和头饰的融合上处理得不太好,人物顺序也容易乱,需要多抽几次卡,才可能出一个勉强还可以的效果。

这组 2.5 输出更符合要求。人物与服饰的对应更准确,“从左到右依次入座”这种方向和顺序也执行得更好。

这一组使用相同的 720P、15 秒参数,2.0 一次 18 元,2.5 一次 28 元。输入和参数接近,所以价格和结果可以放在一起看。

万字干货!手把手教你搭建多模态模型评测体系(一)

人物参考资产图

当视频在手机上无法加载,可前往PC查看。

Seedance 2.0    720p   15s  成本:18¥

当视频在手机上无法加载,可前往PC查看。

Seedance 2.5      720p    15s  成本:28¥

7. 道具替换

道具替换与局部编辑,最容易混淆的,是模型没有按要求做,还是要求根本没有写进提示词。这一题的具体输入是烟斗替换。

原视频里有一个用打火机点烟斗的动作。我给了模型一个新烟斗,让它完成替换。

这道题第一层很明确:烟斗有没有换成功,其他没有要求修改的部分有没有保住。2.5 的确把烟斗换得不错,但仍然沿用了原视频里的打火机。

这里要说清楚:我的显式要求只是替换烟斗,所以它保留打火机,并不能算违反指令。

在这条样本里,模型认真执行了我点名的修改,但没有主动补齐未写进提示词的关联逻辑。烟斗变了,打火机是不是也该一起换,这件事仍然需要创作者主动说明。

如果下一轮要把“关联道具是否同步变化”作为判分项,提示词里就得先把这层要求写进去。没有出现在题目里的要求,不能等结果出来以后再临时拿来扣分。

这特别像真实剧组:你没把道具表说清楚,现场就真的只改你点名的那一个。

当视频在手机上无法加载,可前往PC查看。

【原始参考白模原视频】

当视频在手机上无法加载,可前往PC查看。

【Seedance 2.5 道具替换结果】

只提供了烟斗的参考图,生成的视频拿着打火机点烟斗

8. 风格迁移

我拿真人、动漫人物和不同动漫风格做了几组融合测试,其中还专门试了《双城之战》那种三维渲染结合手绘质感的风格。

这道题第一层看目标风格有没有出现。第二层的门槛更高:人物和场景要进入同一套视觉语言,光是“看得出参考风格”还不够。人物的笔触、背景的材质、光影和空间不能各做各的。

2.5 的确会比 2.0 多遵循一些参考图和提示词里的风格元素。但在我测的这些组合里,人物和场景始终没有真正融在一起:人物是一套笔触,背景是另一套质感,单独看都像那么回事,放进同一个镜头里就是会出戏。

不管是真人与动漫融合,还是两种动漫风格融合,2.0 和 2.5 都没有达到我想要的效果。

这组 2.5 测试是 720P、30 秒,花了 56 元。最后得到的不是“贵但好”,而是“贵了,问题还在”。

这 56 元买到的是一条还不能直接交付的失败样本。后面如果继续抽卡,每按一次,成本还会继续往上加。

这类失败反而特别适合留在评测集里。下一个版本继续跑它,才能知道风格融合的问题到底有没有被修掉。只看官方 Demo 和最好的一次抽卡,很容易把模型上限误认为日常水平。

当视频在手机上无法加载,可前往PC查看。

真人与动漫风格的融合   Seedance2.0  720p 15s  成本18¥

当视频在手机上无法加载,可前往PC查看。

真人与动漫风格的融合   Seedance2.5  720p 15s   成本28¥

万字干货!手把手教你搭建多模态模型评测体系(一)

不同动漫风格的融合 Seedance2.5  720p  30s   成本:¥56

万字干货!手把手教你搭建多模态模型评测体系(一)

两种不同的欧美卡通风格融合参考图

8 组测试里的共同问题:运动流畅性

还有一个贯穿这轮测试的体感:运动流畅性。

它不是第九道单独出的题,而是在看前面多条视频时反复出现的问题。不管是 2.0 还是 2.5,生成出来的视频始终会有一点轻微卡顿,和真人运动的流畅感还是差一点。

这种问题不能靠一张截图判断。截图只能看某一帧有没有变形,卡顿、速度突变、人物和物体接触时的跳动,都要保留连续片段来看。

这个问题在这轮多条样本里反复出现,所以更适合作为跨 Case 的观察项,而不是再单独出一道题。

五、结论

把八组结果放在一起看,Seedance 2.5 生成出来的视频不只是变得更清晰、更长、更贵。

在低模参考优化、物体结构理解和方言这些样本里,2.5 对场景、物体、声音、人物关系和镜头时机的处理,比 2.0 更完整。视频延长、多人替换、人物服饰融合这些任务,也能看出它开始接住更长的时间、更复杂的参考素材和更多的人物关系。

但边界同样明显。人物一多,仍然可能重复;道具替换里,关联道具是否联动,要预先写进题目和过线标准,不能等结果出来以后再临时扣分;人物和场景的风格融合没有达到要求;轻微卡顿也在多条样本里反复出现。

到这里,我对视频模型的判断也发生了变化。它当然还不能替你当导演,但已经越来越像一个会执行指令、也会暴露能力边界的协作对象。Benchmark 的作用,就是让我们知道什么可以交给它,什么仍然必须握在人手里。模型可以接手更多镜头里的工作,但任务拆解、参考、验收、穿帮判断和停止抽卡,仍然要由人负责。

只记住 Seedance 2.5 某一道题做得好不好,下一版出来后很快又要重来。更值得留下来的,是这八道题背后的评测方法:同一个任务能不能持续交付,出了问题能不能被发现,下一次升级还能不能原样验证。

这篇先把 Video Model 的第一版 Benchmark 搭起来。后续我会继续用同一套思路测试其他多模态模型,也把真实复测中的 BadCase 和修订过程保留下来。

模型会继续换,评测方法可以留下来。

收藏
点赞 32

复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。