论文精读
论文精读:Co-RL——群体互评替代 RLHF:公式、机制与 7+4 基准实测
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
本周 HF 最热论文(153 upvotes)。完整拆解:OA/GR 双指标公式、六领域 21 类任务、四阶段数据构建、7 款模型实测——最强模型 OA 仅 37.8%,I2V 全面优于 T2V。