论文精读
论文精读:Co-RL——群体互评替代 RLHF:公式、机制与 7+4 基准实测
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。