📑 目录
一句话结论:Co-RL 让参数不共享的多个模型互为裁判——奖励来自同伴答案的多数投票伪标签,而非自己。群体多样性(异构家族/规模/样本重述)打破自反馈的相关错误闭环。实测:Qwen2.5-3B 在 7 个文本基准平均 +8.6%(49.3 vs 基础 40.7),5 个 VLM 平均 +2.3~7.2%,无任何 ground-truth 标签追平甚至超越监督方法。
要解决的问题
推理 RL 的"监督依赖"困境
RL 提升 LLM/VLM 推理的最强效果依赖可验证奖励(代码测试、数学答案)——但这类标注成本高、且会随推理能力超过人类可评估范围而枯竭。
Self-rewarding 的机制性缺陷
让模型评自己是常见的绕路方案,但论文指出其三条失败路径:
- 相关错误闭环:反馈来自自己(或同源),错误倾向被反复强化
- 响应同质化:单一奖励信号 → 策略坍缩
- 训练崩溃:多样性耗尽后损失震荡、发散
核心洞察:问题不在"无监督",而在"反馈来源与自身相关"——切断相关性,无监督信号就能变干净。
方法拆解(公式级)
交叉智能体监督(Peer Rewards)
伪标签构建(环状拓扑,智能体 n 的监督来自同伴 n−1):
â₋ₙ(x) ∈ argmax_b Σⱼ₌₁ᴷ 𝟙[aₙ₋₁ʲ = b] # K 个采样答案多数投票
奖励分配(硬 0/1):
rₙᵏ = 𝟙[aₙᵏ = â₋ₙ(x)] # 与同伴伪标签一致 → 1
与 GRPO 结合(组内相对优势):
Âₙᵏ = (rₙᵏ − mean{rₙʲ}) / std{rₙʲ} # 组内归一化后进 GRPO 目标
关键点:智能体自身不参与自己监督目标的构建——这是与 self-rewarding 的本质区别。
群体多样性三维度(降低相关错误)
| 维度 | 实现 | 机制 |
|---|---|---|
| 解耦策略优化 | 各智能体独立参数/优化器,不共享梯度,只在奖励阶段交互 | 独立性本身即多样性来源 |
| 跨家族与规模 | 配对 Qwen×Llama(不同分词器/预训练数据)、3B×1.7B 混编 | 不同归纳偏置 → 错误模式正交 |
| 输入形成 | DeepSeek-V3 重述 MATH 问题,两智能体用不同表述训练 | 打破提示措辞相关的共错 |
量化证据(错误解耦分析):不同家族配对(Qwen2.5-3B × Llama-3.2-3B)Cohen’s κ=0.38、互补性 c=31.2%;同家族(×Qwen3-1.7B)κ=0.52、c=24.2%——跨家族的错误重叠显著更低,这是互评有效的根本原因。
训练流程
每步:采样提示批 → 所有智能体并行采样 K 个响应 → 按同伴构建伪标签与奖励 → 同步 GRPO 更新全部策略。对称设计:每个智能体既是学习者又是监督者。
实验数据
文本(表 1,3B 级,7 基准平均):
| 模型 | 基础 | GT-Reward(监督) | 最强自奖励 TTRL | Co-RL |
|---|---|---|---|---|
| Qwen2.5-3B | 40.7 | 47.4 | 47.3 | 49.3(+8.6%) |
| Llama-3.2-3B | 38.7 | 43.0 | 43.1 | 43.9(+5.2%) |
7 基准 = GSM8K/MATH-500/AMC/HumanEval/GPQA/MBPP/LiveCodeBench。Co-RL 平均提升 3.08.6%,**超过最强自奖励基线 0.82.0%**。
多模态(表 4,2B~12B VLM,MathVision/MathVerse/MathVista/We-Math):
| 模型 | 基础 | TTRL | Co-RL |
|---|---|---|---|
| Qwen2.5-VL-3B | 37.24 | 42.54 | 43.89(+6.65%) |
| InternVL-3.5-2B | 43.11 | 45.04 | 45.40 |
更大模型(7B~12B)持续优于 TTRL,Gemma-3-12B 上超过 GT-Reward(监督)。
关键消融:
- 训练稳定性:Co-RL 全程奖励方差/完成长度稳定;TTRL 出现奖励坍缩/长度退化/发散
- 预算公平对比:两模型各自 TTRL 训练 + 推理集成 vs Co-RL 两智能体——Co-RL 仍胜,证明增益来自交叉监督而非集成/算力
- 三智能体扩展:Qwen2.5-3B + Llama-3.2-3B + Qwen3-1.7B 联合训练,三个基础模型分别 +7.8%/+6.0%/+8.2%,平均追平 GT-Reward
- 多智能体基线对比(CoMAS 设置):Co-RL 62.97 分,显著领先 MAPoRL(58.22)/TTRL(58.18)/CoMAS(58.94),且智能体数量减半、无需外部评判器
局限与点评
- 局限 1:群体规模 = 训练成本 ×N;多样性超参(模型组合、重述比例)需调优
- 局限 2:涌现推理是隐式行为,无质量上限保证、无解释性
- 谱系定位:self-rewarding(自己评自己)→ self-play(自己打自己)→ Co-RL(异构群体互评)——在"无外部监督"谱系里,它用多样性换信号质量,与 verifier 路线互补
- 对从业者:缺标注做推理 RL 时,Co-RL 是最值得试的无监督路线;训练基础设施团队可直接借鉴"群体架构 + 多样性调度"设计模式
复现要点
- arXiv: 2608.17253(v2);代码开源 github.com/DrStranded/Co-RL
- 复现门槛:多模型并行训练(先 2 个 3B 验证机制);温度/采样 K 参考论文;环状拓扑伪标签用多数投票
- 建议从"不同家族模型对"起步(错误解耦收益最大),再扩展规模维度
参与讨论
GitHub Discussions 驱动评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。