{
  "title": "论文精读：Co-RL——群体互评替代 RLHF：公式、机制与 7+4 基准实测",
  "url": "/posts/deep-read-co-rl/",
  "permalink": "https://hackcv.com/posts/deep-read-co-rl/",
  "date": "2026-08-23",
  "lastmod": "2026-08-23",
  "author": "hackcv",
  "description": "Co-RL 完整拆解：peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合；3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%，无标签追平监督，代码开源。",
  "categories": ["研究简报"],
  "tags": ["AI","强化学习","多智能体","Co-RL","论文精读"],
  "cover": "https://picsum.photos/seed/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BBco-rl%E7%BE%A4%E4%BD%93%E4%BA%92%E8%AF%84%E6%9B%BF%E4%BB%A3-rlhf%E5%85%AC%E5%BC%8F%E6%9C%BA%E5%88%B6%E4%B8%8E-7\u0026#43;4-%E5%9F%BA%E5%87%86%E5%AE%9E%E6%B5%8B/1200/675",
  "readingTime": 1,
  "wordCount": 218,
  "content": "\u003cblockquote\u003e\n\u003cp\u003e\u003cstrong\u003e一句话结论\u003c/strong\u003e：Co-RL 让参数不共享的多个模型互为裁判——奖励来自\u003cstrong\u003e同伴答案的多数投票伪标签\u003c/strong\u003e，而非自己。群体多样性（异构家族/规模/样本重述）打破自反馈的相关错误闭环。实测：Qwen2.5-3B 在 7 个文本基准平均 \u003cstrong\u003e+8.6%\u003c/strong\u003e（49.3 vs 基础 40.7），5 个 VLM 平均 \u003cstrong\u003e+2.3~7.2%\u003c/strong\u003e，\u003cstrong\u003e无任何 ground-truth 标签追平甚至超越监督方法\u003c/strong\u003e。\u003c/p\u003e\n\u003c/blockquote\u003e\n\u003ch2 id=\"要解决的问题\"\u003e要解决的问题\u003c/h2\u003e\n\u003ch3 id=\"推理-rl-的监督依赖困境\"\u003e推理 RL 的\u0026quot;监督依赖\u0026quot;困境\u003c/h3\u003e\n\u003cp\u003eRL 提升 LLM/VLM 推理的最强效果依赖\u003cstrong\u003e可验证奖励\u003c/strong\u003e（代码测试、数学答案）——但这类标注成本高、且会随推理能力超过人类可评估范围而枯竭。\u003c/p\u003e\n\u003ch3 id=\"self-rewarding-的机制性缺陷\"\u003eSelf-rewarding 的机制性缺陷\u003c/h3\u003e\n\u003cp\u003e让模型评自己是常见的绕路方案，但论文指出其三条失败路径：\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e\u003cstrong\u003e相关错误闭环\u003c/strong\u003e：反馈来自自己（或同源），错误倾向被反复强化\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e响应同质化\u003c/strong\u003e：单一奖励信号 → 策略坍缩\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e训练崩溃\u003c/strong\u003e：多样性耗尽后损失震荡、发散\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003e\u003cstrong\u003e核心洞察\u003c/strong\u003e：问题不在\u0026quot;无监督\u0026quot;，而在\u0026quot;\u003cstrong\u003e反馈来源与自身相关\u003c/strong\u003e\u0026quot;——切断相关性，无监督信号就能变干净。\u003c/p\u003e\n\u003ch2 id=\"方法拆解公式级\"\u003e方法拆解（公式级）\u003c/h2\u003e\n\u003ch3 id=\"交叉智能体监督peer-rewards\"\u003e交叉智能体监督（Peer Rewards）\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e伪标签构建\u003c/strong\u003e（环状拓扑，智能体 n 的监督来自同伴 n−1）：\u003c/p\u003e\n\u003cpre tabindex=\"0\"\u003e\u003ccode\u003eâ₋ₙ(x) ∈ argmax_b Σⱼ₌₁ᴷ 𝟙[aₙ₋₁ʲ = b]      # K 个采样答案多数投票\n\u003c/code\u003e\u003c/pre\u003e\u003cp\u003e\u003cstrong\u003e奖励分配\u003c/strong\u003e（硬 0/1）：\u003c/p\u003e\n\u003cpre tabindex=\"0\"\u003e\u003ccode\u003erₙᵏ = 𝟙[aₙᵏ = â₋ₙ(x)]                     # 与同伴伪标签一致 → 1\n\u003c/code\u003e\u003c/pre\u003e\u003cp\u003e\u003cstrong\u003e与 GRPO 结合\u003c/strong\u003e（组内相对优势）：\u003c/p\u003e\n\u003cpre tabindex=\"0\"\u003e\u003ccode\u003eÂₙᵏ = (rₙᵏ − mean{rₙʲ}) / std{rₙʲ}        # 组内归一化后进 GRPO 目标\n\u003c/code\u003e\u003c/pre\u003e\u003cp\u003e关键点：\u003cstrong\u003e智能体自身不参与自己监督目标的构建\u003c/strong\u003e——这是与 self-rewarding 的本质区别。\u003c/p\u003e\n\u003ch3 id=\"群体多样性三维度降低相关错误\"\u003e群体多样性三维度（降低相关错误）\u003c/h3\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e维度\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e实现\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e机制\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e解耦策略优化\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e各智能体独立参数/优化器，不共享梯度，只在奖励阶段交互\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e独立性本身即多样性来源\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e跨家族与规模\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e配对 Qwen×Llama（不同分词器/预训练数据）、3B×1.7B 混编\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e不同归纳偏置 → 错误模式正交\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e输入形成\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eDeepSeek-V3 重述 MATH 问题，两智能体用不同表述训练\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e打破提示措辞相关的共错\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e\u003cstrong\u003e量化证据\u003c/strong\u003e（错误解耦分析）：不同家族配对（Qwen2.5-3B × Llama-3.2-3B）Cohen\u0026rsquo;s κ=0.38、互补性 c=31.2%；同家族（×Qwen3-1.7B）κ=0.52、c=24.2%——\u003cstrong\u003e跨家族的错误重叠显著更低\u003c/strong\u003e，这是互评有效的根本原因。\u003c/p\u003e\n\u003ch3 id=\"训练流程\"\u003e训练流程\u003c/h3\u003e\n\u003cp\u003e每步：采样提示批 → 所有智能体\u003cstrong\u003e并行\u003c/strong\u003e采样 K 个响应 → 按同伴构建伪标签与奖励 → \u003cstrong\u003e同步\u003c/strong\u003e GRPO 更新全部策略。对称设计：每个智能体既是学习者又是监督者。\u003c/p\u003e\n\u003ch2 id=\"实验数据\"\u003e实验数据\u003c/h2\u003e\n\u003cp\u003e\u003cstrong\u003e文本（表 1，3B 级，7 基准平均）\u003c/strong\u003e：\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e模型\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e基础\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eGT-Reward(监督)\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e最强自奖励 TTRL\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e\u003cstrong\u003eCo-RL\u003c/strong\u003e\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eQwen2.5-3B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e40.7\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e47.4\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e47.3\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e49.3\u003c/strong\u003e（+8.6%）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eLlama-3.2-3B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e38.7\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e43.0\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e43.1\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e43.9\u003c/strong\u003e（+5.2%）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e7 基准 = GSM8K/MATH-500/AMC/HumanEval/GPQA/MBPP/LiveCodeBench。Co-RL 平均提升 3.0\u003cdel\u003e8.6%，**超过最强自奖励基线 0.8\u003c/del\u003e2.0%**。\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003e多模态（表 4，2B~12B VLM，MathVision/MathVerse/MathVista/We-Math）\u003c/strong\u003e：\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003e模型\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e基础\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eTTRL\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003e\u003cstrong\u003eCo-RL\u003c/strong\u003e\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eQwen2.5-VL-3B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e37.24\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e42.54\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e43.89\u003c/strong\u003e（+6.65%）\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003eInternVL-3.5-2B\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e43.11\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e45.04\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e45.40\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cp\u003e更大模型（7B~12B）持续优于 TTRL，\u003cstrong\u003eGemma-3-12B 上超过 GT-Reward（监督）\u003c/strong\u003e。\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003e关键消融\u003c/strong\u003e：\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e训练稳定性\u003c/strong\u003e：Co-RL 全程奖励方差/完成长度稳定；TTRL 出现奖励坍缩/长度退化/发散\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e预算公平对比\u003c/strong\u003e：两模型各自 TTRL 训练 + 推理集成 vs Co-RL 两智能体——Co-RL 仍胜，证明增益来自\u003cstrong\u003e交叉监督\u003c/strong\u003e而非集成/算力\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e三智能体扩展\u003c/strong\u003e：Qwen2.5-3B + Llama-3.2-3B + Qwen3-1.7B 联合训练，三个基础模型分别 +7.8%/+6.0%/+8.2%，平均追平 GT-Reward\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e多智能体基线对比\u003c/strong\u003e（CoMAS 设置）：Co-RL 62.97 分，显著领先 MAPoRL(58.22)/TTRL(58.18)/CoMAS(58.94)，且智能体数量减半、无需外部评判器\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2 id=\"局限与点评\"\u003e局限与点评\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003e局限 1\u003c/strong\u003e：群体规模 = 训练成本 ×N；多样性超参（模型组合、重述比例）需调优\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e局限 2\u003c/strong\u003e：涌现推理是隐式行为，无质量上限保证、无解释性\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e谱系定位\u003c/strong\u003e：self-rewarding（自己评自己）→ self-play（自己打自己）→ \u003cstrong\u003eCo-RL（异构群体互评）\u003c/strong\u003e——在\u0026quot;无外部监督\u0026quot;谱系里，它用多样性换信号质量，与 verifier 路线互补\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003e对从业者\u003c/strong\u003e：缺标注做推理 RL 时，Co-RL 是最值得试的无监督路线；训练基础设施团队可直接借鉴\u0026quot;群体架构 + 多样性调度\u0026quot;设计模式\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2 id=\"复现要点\"\u003e复现要点\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003earXiv: 2608.17253（v2）；代码开源 \u003cstrong\u003egithub.com/DrStranded/Co-RL\u003c/strong\u003e\u003c/li\u003e\n\u003cli\u003e复现门槛：多模型并行训练（先 2 个 3B 验证机制）；温度/采样 K 参考论文；环状拓扑伪标签用多数投票\u003c/li\u003e\n\u003cli\u003e建议从\u0026quot;不同家族模型对\u0026quot;起步（错误解耦收益最大），再扩展规模维度\u003c/li\u003e\n\u003c/ul\u003e\n",
  "summary": " 一句话结论：Co-RL 让参数不共享的多个模型互为裁判——奖励来自同伴答案的多数投票伪标签，而非自己。群体多样性（异构家族/规模/样本重述）打破自反馈的相关错误闭环。实测：Qwen2.5-3B 在 7 个文本基准平均 +8.6%（49.3 vs 基础 40.7），5 个 VLM 平均 +2.3~7.2%，无任何 ground-truth 标签追平甚至超越监督方法。\n要解决的问题 推理 RL 的\u0026quot;监督依赖\u0026quot;困境 RL 提升 LLM/VLM 推理的最强效果依赖可验证奖励（代码测试、数学答案）——但这类标注成本高、且会随推理能力超过人类可评估范围而枯竭。\nSelf-rewarding 的机制性缺陷 让模型评自己是常见的绕路方案，但论文指出其三条失败路径：\n相关错误闭环：反馈来自自己（或同源），错误倾向被反复强化 响应同质化：单一奖励信号 → 策略坍缩 训练崩溃：多样性耗尽后损失震荡、发散 核心洞察：问题不在\u0026quot;无监督\u0026quot;，而在\u0026quot;反馈来源与自身相关\u0026quot;——切断相关性，无监督信号就能变干净。\n方法拆解（公式级） 交叉智能体监督（Peer Rewards） 伪标签构建（环状拓扑，智能体 n 的监督来自同伴 n−1）：\nâ₋ₙ(x) ∈ argmax_b Σⱼ₌₁ᴷ 𝟙[aₙ₋₁ʲ = b] # K 个采样答案多数投票 奖励分配（硬 0/1）：\nrₙᵏ = 𝟙[aₙᵏ = â₋ₙ(x)] # 与同伴伪标签一致 → 1 与 GRPO 结合（组内相对优势）：\nÂₙᵏ = (rₙᵏ − mean{rₙʲ}) / std{rₙʲ} # 组内归一化后进 GRPO 目标 关键点：智能体自身不参与自己监督目标的构建——这是与 self-rewarding 的本质区别。\n"
}
