📑 目录

一句话结论:Co-RL 让参数不共享的多个模型互为裁判——奖励来自同伴答案的多数投票伪标签,而非自己。群体多样性(异构家族/规模/样本重述)打破自反馈的相关错误闭环。实测:Qwen2.5-3B 在 7 个文本基准平均 +8.6%(49.3 vs 基础 40.7),5 个 VLM 平均 +2.3~7.2%无任何 ground-truth 标签追平甚至超越监督方法

要解决的问题

推理 RL 的"监督依赖"困境

RL 提升 LLM/VLM 推理的最强效果依赖可验证奖励(代码测试、数学答案)——但这类标注成本高、且会随推理能力超过人类可评估范围而枯竭。

Self-rewarding 的机制性缺陷

让模型评自己是常见的绕路方案,但论文指出其三条失败路径:

  1. 相关错误闭环:反馈来自自己(或同源),错误倾向被反复强化
  2. 响应同质化:单一奖励信号 → 策略坍缩
  3. 训练崩溃:多样性耗尽后损失震荡、发散

核心洞察:问题不在"无监督",而在"反馈来源与自身相关"——切断相关性,无监督信号就能变干净。

方法拆解(公式级)

交叉智能体监督(Peer Rewards)

伪标签构建(环状拓扑,智能体 n 的监督来自同伴 n−1):

â₋ₙ(x) ∈ argmax_b Σⱼ₌₁ᴷ 𝟙[aₙ₋₁ʲ = b]      # K 个采样答案多数投票

奖励分配(硬 0/1):

rₙᵏ = 𝟙[aₙᵏ = â₋ₙ(x)]                     # 与同伴伪标签一致 → 1

与 GRPO 结合(组内相对优势):

Âₙᵏ = (rₙᵏ − mean{rₙʲ}) / std{rₙʲ}        # 组内归一化后进 GRPO 目标

关键点:智能体自身不参与自己监督目标的构建——这是与 self-rewarding 的本质区别。

群体多样性三维度(降低相关错误)

维度 实现 机制
解耦策略优化 各智能体独立参数/优化器,不共享梯度,只在奖励阶段交互 独立性本身即多样性来源
跨家族与规模 配对 Qwen×Llama(不同分词器/预训练数据)、3B×1.7B 混编 不同归纳偏置 → 错误模式正交
输入形成 DeepSeek-V3 重述 MATH 问题,两智能体用不同表述训练 打破提示措辞相关的共错

量化证据(错误解耦分析):不同家族配对(Qwen2.5-3B × Llama-3.2-3B)Cohen’s κ=0.38、互补性 c=31.2%;同家族(×Qwen3-1.7B)κ=0.52、c=24.2%——跨家族的错误重叠显著更低,这是互评有效的根本原因。

训练流程

每步:采样提示批 → 所有智能体并行采样 K 个响应 → 按同伴构建伪标签与奖励 → 同步 GRPO 更新全部策略。对称设计:每个智能体既是学习者又是监督者。

实验数据

文本(表 1,3B 级,7 基准平均)

模型 基础 GT-Reward(监督) 最强自奖励 TTRL Co-RL
Qwen2.5-3B 40.7 47.4 47.3 49.3(+8.6%)
Llama-3.2-3B 38.7 43.0 43.1 43.9(+5.2%)

7 基准 = GSM8K/MATH-500/AMC/HumanEval/GPQA/MBPP/LiveCodeBench。Co-RL 平均提升 3.08.6%,**超过最强自奖励基线 0.82.0%**。

多模态(表 4,2B~12B VLM,MathVision/MathVerse/MathVista/We-Math)

模型 基础 TTRL Co-RL
Qwen2.5-VL-3B 37.24 42.54 43.89(+6.65%)
InternVL-3.5-2B 43.11 45.04 45.40

更大模型(7B~12B)持续优于 TTRL,Gemma-3-12B 上超过 GT-Reward(监督)

关键消融

  • 训练稳定性:Co-RL 全程奖励方差/完成长度稳定;TTRL 出现奖励坍缩/长度退化/发散
  • 预算公平对比:两模型各自 TTRL 训练 + 推理集成 vs Co-RL 两智能体——Co-RL 仍胜,证明增益来自交叉监督而非集成/算力
  • 三智能体扩展:Qwen2.5-3B + Llama-3.2-3B + Qwen3-1.7B 联合训练,三个基础模型分别 +7.8%/+6.0%/+8.2%,平均追平 GT-Reward
  • 多智能体基线对比(CoMAS 设置):Co-RL 62.97 分,显著领先 MAPoRL(58.22)/TTRL(58.18)/CoMAS(58.94),且智能体数量减半、无需外部评判器

局限与点评

  • 局限 1:群体规模 = 训练成本 ×N;多样性超参(模型组合、重述比例)需调优
  • 局限 2:涌现推理是隐式行为,无质量上限保证、无解释性
  • 谱系定位:self-rewarding(自己评自己)→ self-play(自己打自己)→ Co-RL(异构群体互评)——在"无外部监督"谱系里,它用多样性换信号质量,与 verifier 路线互补
  • 对从业者:缺标注做推理 RL 时,Co-RL 是最值得试的无监督路线;训练基础设施团队可直接借鉴"群体架构 + 多样性调度"设计模式

复现要点

  • arXiv: 2608.17253(v2);代码开源 github.com/DrStranded/Co-RL
  • 复现门槛:多模型并行训练(先 2 个 3B 验证机制);温度/采样 K 参考论文;环状拓扑伪标签用多数投票
  • 建议从"不同家族模型对"起步(错误解耦收益最大),再扩展规模维度

参与讨论

GitHub Discussions 驱动

评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。