{
  "title": "论文精读：SemComp-Bench——视频生成评测从「像不像」走向「做没做成」",
  "url": "/posts/deep-read-semcomp-bench/",
  "permalink": "https://hackcv.com/posts/deep-read-semcomp-bench/",
  "date": "2026-08-23",
  "lastmod": "2026-08-23",
  "author": "hackcv",
  "description": "本周 HF 最热论文（153 upvotes）。完整拆解：OA/GR 双指标公式、六领域 21 类任务、四阶段数据构建、7 款模型实测——最强模型 OA 仅 37.8%，I2V 全面优于 T2V。",
  "categories": ["研究简报"],
  "tags": ["AI","视频生成","评测基准","SemComp-Bench","论文精读"],
  "cover": "https://picsum.photos/seed/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BBsemcomp-bench%E8%A7%86%E9%A2%91%E7%94%9F%E6%88%90%E8%AF%84%E6%B5%8B%E4%BB%8E%E5%83%8F%E4%B8%8D%E5%83%8F%E8%B5%B0%E5%90%91%E5%81%9A%E6%B2%A1%E5%81%9A%E6%88%90/1200/675",
  "readingTime": 1,
  "wordCount": 292,
  "content": "\u003cblockquote\u003e\n\u003cp\u003e\u003cstrong\u003e一句话结论\u003c/strong\u003e：SemComp-Bench 把视频生成重定义为\u003cstrong\u003e结果导向的语义任务完成\u003c/strong\u003e，用 1,273 个六领域实例 + VLM 结构化二元问答评测（OA/GR 双分数）。实测 7 款主流模型：\u003cstrong\u003e最强 OA 仅 37.8%\u003c/strong\u003e、I2V 全面优于 T2V、场景内时空一致性是所有模型的共同瓶颈——\u0026ldquo;画质卷到头，任务完成是下一个分水岭\u0026quot;被数据坐实。\u003c/p\u003e\n\u003c/blockquote\u003e\n\u003ch2 id=\"要解决的问题\"\u003e要解决的问题\u003c/h2\u003e\n\u003cp\u003e\u003cstrong\u003e背景\u003c/strong\u003e：视频生成评测长期被画质指标统治——FVD、CLIP 相似度、人工偏好。它们衡量\u0026quot;生成得像不像真实视频\u0026rdquo;，\u003cstrong\u003e完全不感知任务目标\u003c/strong\u003e。\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003e根本缺陷\u003c/strong\u003e：一个\u0026quot;要求把咖啡杯从桌上移到窗台\u0026quot;的视频，若模型只生成了杯子的精美特写，FVD 可能依然很高——因为 FVD 比较帧分布，与\u0026quot;杯子有没有被移动\u0026quot;无关。当可控视频生成走向应用，\u0026ldquo;目标是否达成\u0026quot;成为唯一验收标准，旧指标彻底失灵。\u003c/p\u003e\n\u003ch2 id=\"方法拆解\"\u003e方法拆解\u003c/h2\u003e\n\u003ch3 id=\"任务重定义semantic-task-completion\"\u003e任务重定义：Semantic Task Completion\u003c/h3\u003e\n\u003cp\u003e成功 = \u003cstrong\u003e结果达成（Outcome Achievement）\u003c/strong\u003e × \u003cstrong\u003e语义接地（Semantic Grounding）\u003c/strong\u003e。只评估最终结果，不要求完整中间步骤、不要求与参考图的外观一致性。\u003c/p\u003e\n\u003ch3 id=\"数据semcomp-data六领域-21-类\"\u003e数据：SemComp-Data（六领域 21 类）\u003c/h3\u003e\n\u003cp\u003e从 Koala-36M 采样 ~20K 视频，产出 \u003cstrong\u003e1,273 个实例\u003c/strong\u003e，每个实例 = \u003ccode\u003e(参考帧, 指令对{简要+详细}, 结果导向剪辑)\u003c/code\u003e，参考帧与剪辑取自同一视频（保证任务真实可行）。四阶段构建：\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e阶段\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e做法\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e候选筛选\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e45 个关键词（新闻/电影/娱乐三组）剔除依赖旁白的视频；VLM 分类到六领域，证据不足标 Uncertain 丢弃\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e状态挖掘\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e帧级时间戳定位（State Grounding）+ QA 式检查：VLM 选\u0026quot;哪帧是结果\u0026rdquo;，与定位不一致则保守丢弃\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e视频扩展\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003ePanda-70M 镜头检测 + 同场景合并，以结果时间戳为锚点扩到 3~4 秒（实测均值 4.03s）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e指令构建\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e简要指令 ≤30 词（\u003ccode\u003e动词+主主语+介词+结果状态\u003c/code\u003e）；详细指令 + 17 项属性词汇表（object_category/person_identity/spatial_relation/pose…）选对齐类型\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e六领域：Food \u0026amp; Cooking、Beauty \u0026amp; Fashion、Sports \u0026amp; Fitness、Crafts \u0026amp; DIY、Gardening \u0026amp; Pets、Arts \u0026amp; Precision（每域 3-5 个细分类）。\u003c/p\u003e\n\u003ch3 id=\"评估协议vlm-回答结构化二元问题\"\u003e评估协议：VLM 回答结构化二元问题\u003c/h3\u003e\n\u003cp\u003e生成视频均匀采样 \u003cstrong\u003e27 帧\u003c/strong\u003e，每视频 \u003cstrong\u003e3 次独立 VLM 调用\u003c/strong\u003e（Doubao-Seed-1.8）取均值。\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eOA 维度\u003c/strong\u003e（4 个 yes/no 问题，\u003cstrong\u003e合取式\u003c/strong\u003e——全部通过才算达成）：\u003c/p\u003e\n\u003cpre tabindex=\"0\"\u003e\u003ccode\u003eAᵢ = a_or × a_sg × a_gec × a_gvc ∈ {0,1}     OA Score = (1/N)ΣAᵢ\n\u003c/code\u003e\u003c/pre\u003e\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e问题\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e判定\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003ea_or 结果实现\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e粗语义上达到指令指定的完成状态？\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003ea_sg 语义接地\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e结果是否按参考-指令保留/修改了任务相关实体属性？\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003ea_gec 实体一致性\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e关键实体无消失/替换/身份漂移？（反向，否→1）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003ea_gvc 全局连续性\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e无场景/视角/布局突变？（反向，否→1）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e\u003cstrong\u003eGR 维度\u003c/strong\u003e（5 个 yes/no 问题，\u003cstrong\u003e算术平均\u003c/strong\u003e）：\u003c/p\u003e\n\u003cpre tabindex=\"0\"\u003e\u003ccode\u003eGᵢ = (g_pp + g_vc + g_afr + g_wsc + g_ti)/5     GR Score = (1/N)ΣGᵢ\n\u003c/code\u003e\u003c/pre\u003e\u003cp\u003e物理合理性 / 视觉清晰度 / 无伪影 / 场景内时空一致性 / 文本界面完整性。\u003c/p\u003e\n\u003ch2 id=\"实验数据semcomp-core60-实例分层抽样\"\u003e实验数据（SemComp-Core：60 实例分层抽样）\u003c/h2\u003e\n\u003cp\u003e\u003cstrong\u003e表 1：OA Score（详细指令 I2V）\u003c/strong\u003e\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e模型\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eA_or\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eA_sg\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eA_gec\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eA_gvc\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e\u003cstrong\u003eOA\u003c/strong\u003e\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eHY†-1.5-720P-I2V\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.878\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.706\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.583\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.794\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e37.8%\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eWan2.2-I2V-A14B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.800\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.528\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.628\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.789\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e28.3%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eWan2.2-TI2V-5B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.589\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.400\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.689\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.922\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e23.3%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eSkyReels-V2-14B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.733\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.489\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.522\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.772\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e22.8%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eSeedance 2.0\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.839\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.744\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.444\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.594\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e20.0%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eCogVideoX1.5-5B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.550\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.389\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.506\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.744\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e14.4%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003ePhantom-1.3B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.539\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.356\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.322\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.511\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e3.9%\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e（†HY = HunyuanVideo。GR 榜：Seedance 2.0 以 91.8% 居首，Wan2.2-A14B 89.0% 次之）\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003e关键发现\u003c/strong\u003e：\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e\u003cstrong\u003e最强 OA 仅 37.8%\u003c/strong\u003e——\u0026ldquo;达成目标 + 保持参考语义接地\u0026quot;对当前模型普遍困难\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eI2V 全面优于 T2V\u003c/strong\u003e（三个模型家族一致）：增益来自语义接地/实体一致性/全局连续性；结果实现率两模态相当\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e指令特异性权衡\u003c/strong\u003e：详细指令 OA 更高但生成更难；简要指令更易连贯但任务完成率低（CogVideoX T2V-brief OA 仅 0.6%）\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e场景内时空一致性是全局瓶颈\u003c/strong\u003e：所有模型 G_wsc ∈ 0.328~0.739\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eGR 与 OA 不对应\u003c/strong\u003e：Seedance GR 第一（91.8%）但 OA 仅 20%——\u0026ldquo;画得稳\u0026quot;和\u0026quot;做得成\u0026quot;是两回事，双指标缺一不可\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003e（三次运行标准差：OA 0.96\u003cdel\u003e4.41pp、GR 1.35\u003c/del\u003e7.20pp，Seedance OA 波动最大）\u003c/p\u003e\n\u003ch2 id=\"局限与点评\"\u003e局限与点评\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e局限 1\u003c/strong\u003e：VLM 判定器可靠性是双刃剑——对物理合理性/精确空间关系可能不敏感，需人工抽检校准（论文报告了单标准差异常值，如 G_wsc 标准差最高 15.84pp）\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e局限 2\u003c/strong\u003e：六领域仍偏\u0026quot;生活操作\u0026rdquo;，真实生产力任务空间更大\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e对从业者\u003c/strong\u003e：评测思路可直接迁移——凡\u0026quot;生成结果要被使用\u0026quot;的管线，验收应从相似度转向目标达成率。落地路径：小规模任务集 + VLM 判定器（Doubao/Claude/GPT 均可），先替代人工验收再扩展\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2 id=\"复现要点\"\u003e复现要点\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003earXiv: 2608.17426；数据/评估脚本随论文发布\u003c/li\u003e\n\u003cli\u003e评估成本：每视频 3 次 VLM 调用 + 27 帧采样，预算可控\u003c/li\u003e\n\u003cli\u003e指标实现要点：OA 必须用\u003cstrong\u003e合取式\u003c/strong\u003e（4 项全过才算达成），GR 用算术平均——两者语义不同，勿混用\u003c/li\u003e\n\u003c/ul\u003e\n",
  "summary": " 一句话结论：SemComp-Bench 把视频生成重定义为结果导向的语义任务完成，用 1,273 个六领域实例 + VLM 结构化二元问答评测（OA/GR 双分数）。实测 7 款主流模型：最强 OA 仅 37.8%、I2V 全面优于 T2V、场景内时空一致性是所有模型的共同瓶颈——\u0026ldquo;画质卷到头，任务完成是下一个分水岭\u0026quot;被数据坐实。\n要解决的问题 背景：视频生成评测长期被画质指标统治——FVD、CLIP 相似度、人工偏好。它们衡量\u0026quot;生成得像不像真实视频\u0026rdquo;，完全不感知任务目标。\n根本缺陷：一个\u0026quot;要求把咖啡杯从桌上移到窗台\u0026quot;的视频，若模型只生成了杯子的精美特写，FVD 可能依然很高——因为 FVD 比较帧分布，与\u0026quot;杯子有没有被移动\u0026quot;无关。当可控视频生成走向应用，\u0026ldquo;目标是否达成\u0026quot;成为唯一验收标准，旧指标彻底失灵。\n方法拆解 任务重定义：Semantic Task Completion 成功 = 结果达成（Outcome Achievement） × 语义接地（Semantic Grounding）。只评估最终结果，不要求完整中间步骤、不要求与参考图的外观一致性。\n数据：SemComp-Data（六领域 21 类） 从 Koala-36M 采样 ~20K 视频，产出 1,273 个实例，每个实例 = (参考帧, 指令对{简要+详细}, 结果导向剪辑)，参考帧与剪辑取自同一视频（保证任务真实可行）。四阶段构建：\n阶段 做法 候选筛选 45 个关键词（新闻/电影/娱乐三组）剔除依赖旁白的视频；VLM 分类到六领域，证据不足标 Uncertain 丢弃 状态挖掘 帧级时间戳定位（State Grounding）+ QA 式检查：VLM 选\u0026quot;哪帧是结果\u0026rdquo;，与定位不一致则保守丢弃 视频扩展 Panda-70M 镜头检测 + 同场景合并，以结果时间戳为锚点扩到 3~4 秒（实测均值 4.03s） 指令构建 简要指令 ≤30 词（动词+主主语+介词+结果状态）；详细指令 + 17 项属性词汇表（object_category/person_identity/spatial_relation/pose…）选对齐类型 六领域：Food \u0026amp; Cooking、Beauty \u0026amp; Fashion、Sports \u0026amp; Fitness、Crafts \u0026amp; DIY、Gardening \u0026amp; Pets、Arts \u0026amp; Precision（每域 3-5 个细分类）。\n"
}
