📑 目录
一句话结论:SemComp-Bench 把视频生成重定义为结果导向的语义任务完成,用 1,273 个六领域实例 + VLM 结构化二元问答评测(OA/GR 双分数)。实测 7 款主流模型:最强 OA 仅 37.8%、I2V 全面优于 T2V、场景内时空一致性是所有模型的共同瓶颈——“画质卷到头,任务完成是下一个分水岭"被数据坐实。
要解决的问题
背景:视频生成评测长期被画质指标统治——FVD、CLIP 相似度、人工偏好。它们衡量"生成得像不像真实视频”,完全不感知任务目标。
根本缺陷:一个"要求把咖啡杯从桌上移到窗台"的视频,若模型只生成了杯子的精美特写,FVD 可能依然很高——因为 FVD 比较帧分布,与"杯子有没有被移动"无关。当可控视频生成走向应用,“目标是否达成"成为唯一验收标准,旧指标彻底失灵。
方法拆解
任务重定义:Semantic Task Completion
成功 = 结果达成(Outcome Achievement) × 语义接地(Semantic Grounding)。只评估最终结果,不要求完整中间步骤、不要求与参考图的外观一致性。
数据:SemComp-Data(六领域 21 类)
从 Koala-36M 采样 ~20K 视频,产出 1,273 个实例,每个实例 = (参考帧, 指令对{简要+详细}, 结果导向剪辑),参考帧与剪辑取自同一视频(保证任务真实可行)。四阶段构建:
| 阶段 | 做法 |
|---|---|
| 候选筛选 | 45 个关键词(新闻/电影/娱乐三组)剔除依赖旁白的视频;VLM 分类到六领域,证据不足标 Uncertain 丢弃 |
| 状态挖掘 | 帧级时间戳定位(State Grounding)+ QA 式检查:VLM 选"哪帧是结果”,与定位不一致则保守丢弃 |
| 视频扩展 | Panda-70M 镜头检测 + 同场景合并,以结果时间戳为锚点扩到 3~4 秒(实测均值 4.03s) |
| 指令构建 | 简要指令 ≤30 词(动词+主主语+介词+结果状态);详细指令 + 17 项属性词汇表(object_category/person_identity/spatial_relation/pose…)选对齐类型 |
六领域:Food & Cooking、Beauty & Fashion、Sports & Fitness、Crafts & DIY、Gardening & Pets、Arts & Precision(每域 3-5 个细分类)。
评估协议:VLM 回答结构化二元问题
生成视频均匀采样 27 帧,每视频 3 次独立 VLM 调用(Doubao-Seed-1.8)取均值。
OA 维度(4 个 yes/no 问题,合取式——全部通过才算达成):
Aᵢ = a_or × a_sg × a_gec × a_gvc ∈ {0,1} OA Score = (1/N)ΣAᵢ
| 问题 | 判定 |
|---|---|
| a_or 结果实现 | 粗语义上达到指令指定的完成状态? |
| a_sg 语义接地 | 结果是否按参考-指令保留/修改了任务相关实体属性? |
| a_gec 实体一致性 | 关键实体无消失/替换/身份漂移?(反向,否→1) |
| a_gvc 全局连续性 | 无场景/视角/布局突变?(反向,否→1) |
GR 维度(5 个 yes/no 问题,算术平均):
Gᵢ = (g_pp + g_vc + g_afr + g_wsc + g_ti)/5 GR Score = (1/N)ΣGᵢ
物理合理性 / 视觉清晰度 / 无伪影 / 场景内时空一致性 / 文本界面完整性。
实验数据(SemComp-Core:60 实例分层抽样)
表 1:OA Score(详细指令 I2V)
| 模型 | A_or | A_sg | A_gec | A_gvc | OA |
|---|---|---|---|---|---|
| HY†-1.5-720P-I2V | 0.878 | 0.706 | 0.583 | 0.794 | 37.8% |
| Wan2.2-I2V-A14B | 0.800 | 0.528 | 0.628 | 0.789 | 28.3% |
| Wan2.2-TI2V-5B | 0.589 | 0.400 | 0.689 | 0.922 | 23.3% |
| SkyReels-V2-14B | 0.733 | 0.489 | 0.522 | 0.772 | 22.8% |
| Seedance 2.0 | 0.839 | 0.744 | 0.444 | 0.594 | 20.0% |
| CogVideoX1.5-5B | 0.550 | 0.389 | 0.506 | 0.744 | 14.4% |
| Phantom-1.3B | 0.539 | 0.356 | 0.322 | 0.511 | 3.9% |
(†HY = HunyuanVideo。GR 榜:Seedance 2.0 以 91.8% 居首,Wan2.2-A14B 89.0% 次之)
关键发现:
- 最强 OA 仅 37.8%——“达成目标 + 保持参考语义接地"对当前模型普遍困难
- I2V 全面优于 T2V(三个模型家族一致):增益来自语义接地/实体一致性/全局连续性;结果实现率两模态相当
- 指令特异性权衡:详细指令 OA 更高但生成更难;简要指令更易连贯但任务完成率低(CogVideoX T2V-brief OA 仅 0.6%)
- 场景内时空一致性是全局瓶颈:所有模型 G_wsc ∈ 0.328~0.739
- GR 与 OA 不对应:Seedance GR 第一(91.8%)但 OA 仅 20%——“画得稳"和"做得成"是两回事,双指标缺一不可
(三次运行标准差:OA 0.964.41pp、GR 1.357.20pp,Seedance OA 波动最大)
局限与点评
- 局限 1:VLM 判定器可靠性是双刃剑——对物理合理性/精确空间关系可能不敏感,需人工抽检校准(论文报告了单标准差异常值,如 G_wsc 标准差最高 15.84pp)
- 局限 2:六领域仍偏"生活操作”,真实生产力任务空间更大
- 对从业者:评测思路可直接迁移——凡"生成结果要被使用"的管线,验收应从相似度转向目标达成率。落地路径:小规模任务集 + VLM 判定器(Doubao/Claude/GPT 均可),先替代人工验收再扩展
复现要点
- arXiv: 2608.17426;数据/评估脚本随论文发布
- 评估成本:每视频 3 次 VLM 调用 + 27 帧采样,预算可控
- 指标实现要点:OA 必须用合取式(4 项全过才算达成),GR 用算术平均——两者语义不同,勿混用
参与讨论
GitHub Discussions 驱动评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。