📑 目录

一句话结论:SemComp-Bench 把视频生成重定义为结果导向的语义任务完成,用 1,273 个六领域实例 + VLM 结构化二元问答评测(OA/GR 双分数)。实测 7 款主流模型:最强 OA 仅 37.8%、I2V 全面优于 T2V、场景内时空一致性是所有模型的共同瓶颈——“画质卷到头,任务完成是下一个分水岭"被数据坐实。

要解决的问题

背景:视频生成评测长期被画质指标统治——FVD、CLIP 相似度、人工偏好。它们衡量"生成得像不像真实视频”,完全不感知任务目标

根本缺陷:一个"要求把咖啡杯从桌上移到窗台"的视频,若模型只生成了杯子的精美特写,FVD 可能依然很高——因为 FVD 比较帧分布,与"杯子有没有被移动"无关。当可控视频生成走向应用,“目标是否达成"成为唯一验收标准,旧指标彻底失灵。

方法拆解

任务重定义:Semantic Task Completion

成功 = 结果达成(Outcome Achievement) × 语义接地(Semantic Grounding)。只评估最终结果,不要求完整中间步骤、不要求与参考图的外观一致性。

数据:SemComp-Data(六领域 21 类)

从 Koala-36M 采样 ~20K 视频,产出 1,273 个实例,每个实例 = (参考帧, 指令对{简要+详细}, 结果导向剪辑),参考帧与剪辑取自同一视频(保证任务真实可行)。四阶段构建:

阶段 做法
候选筛选 45 个关键词(新闻/电影/娱乐三组)剔除依赖旁白的视频;VLM 分类到六领域,证据不足标 Uncertain 丢弃
状态挖掘 帧级时间戳定位(State Grounding)+ QA 式检查:VLM 选"哪帧是结果”,与定位不一致则保守丢弃
视频扩展 Panda-70M 镜头检测 + 同场景合并,以结果时间戳为锚点扩到 3~4 秒(实测均值 4.03s)
指令构建 简要指令 ≤30 词(动词+主主语+介词+结果状态);详细指令 + 17 项属性词汇表(object_category/person_identity/spatial_relation/pose…)选对齐类型

六领域:Food & Cooking、Beauty & Fashion、Sports & Fitness、Crafts & DIY、Gardening & Pets、Arts & Precision(每域 3-5 个细分类)。

评估协议:VLM 回答结构化二元问题

生成视频均匀采样 27 帧,每视频 3 次独立 VLM 调用(Doubao-Seed-1.8)取均值。

OA 维度(4 个 yes/no 问题,合取式——全部通过才算达成):

Aᵢ = a_or × a_sg × a_gec × a_gvc ∈ {0,1}     OA Score = (1/N)ΣAᵢ
问题 判定
a_or 结果实现 粗语义上达到指令指定的完成状态?
a_sg 语义接地 结果是否按参考-指令保留/修改了任务相关实体属性?
a_gec 实体一致性 关键实体无消失/替换/身份漂移?(反向,否→1)
a_gvc 全局连续性 无场景/视角/布局突变?(反向,否→1)

GR 维度(5 个 yes/no 问题,算术平均):

Gᵢ = (g_pp + g_vc + g_afr + g_wsc + g_ti)/5     GR Score = (1/N)ΣGᵢ

物理合理性 / 视觉清晰度 / 无伪影 / 场景内时空一致性 / 文本界面完整性。

实验数据(SemComp-Core:60 实例分层抽样)

表 1:OA Score(详细指令 I2V)

模型 A_or A_sg A_gec A_gvc OA
HY†-1.5-720P-I2V 0.878 0.706 0.583 0.794 37.8%
Wan2.2-I2V-A14B 0.800 0.528 0.628 0.789 28.3%
Wan2.2-TI2V-5B 0.589 0.400 0.689 0.922 23.3%
SkyReels-V2-14B 0.733 0.489 0.522 0.772 22.8%
Seedance 2.0 0.839 0.744 0.444 0.594 20.0%
CogVideoX1.5-5B 0.550 0.389 0.506 0.744 14.4%
Phantom-1.3B 0.539 0.356 0.322 0.511 3.9%

(†HY = HunyuanVideo。GR 榜:Seedance 2.0 以 91.8% 居首,Wan2.2-A14B 89.0% 次之)

关键发现

  1. 最强 OA 仅 37.8%——“达成目标 + 保持参考语义接地"对当前模型普遍困难
  2. I2V 全面优于 T2V(三个模型家族一致):增益来自语义接地/实体一致性/全局连续性;结果实现率两模态相当
  3. 指令特异性权衡:详细指令 OA 更高但生成更难;简要指令更易连贯但任务完成率低(CogVideoX T2V-brief OA 仅 0.6%)
  4. 场景内时空一致性是全局瓶颈:所有模型 G_wsc ∈ 0.328~0.739
  5. GR 与 OA 不对应:Seedance GR 第一(91.8%)但 OA 仅 20%——“画得稳"和"做得成"是两回事,双指标缺一不可

(三次运行标准差:OA 0.964.41pp、GR 1.357.20pp,Seedance OA 波动最大)

局限与点评

  • 局限 1:VLM 判定器可靠性是双刃剑——对物理合理性/精确空间关系可能不敏感,需人工抽检校准(论文报告了单标准差异常值,如 G_wsc 标准差最高 15.84pp)
  • 局限 2:六领域仍偏"生活操作”,真实生产力任务空间更大
  • 对从业者:评测思路可直接迁移——凡"生成结果要被使用"的管线,验收应从相似度转向目标达成率。落地路径:小规模任务集 + VLM 判定器(Doubao/Claude/GPT 均可),先替代人工验收再扩展

复现要点

  • arXiv: 2608.17426;数据/评估脚本随论文发布
  • 评估成本:每视频 3 次 VLM 调用 + 27 帧采样,预算可控
  • 指标实现要点:OA 必须用合取式(4 项全过才算达成),GR 用算术平均——两者语义不同,勿混用

参与讨论

GitHub Discussions 驱动

评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。