Paper Review
Paper Review: Co-RL — Peer Rewards Replace RLHF: Formulas, Mechanism, and 7+4 Benchmark Results
Co-RL full breakdown: peer-reward pseudo-label formulas, ring-topology majority voting, three diversity dimensions, GRPO integration; Qwen2.5-3B +8.6% avg across 7 text benchmarks, VLM +7.2% across 4, label-free parity with supervised methods, code open-sourced.