论文精读
论文精读:Co-RL——群体互评替代 RLHF:公式、机制与 7+4 基准实测
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
论文精读 × 算法解读,读懂方法与架构取舍
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
本周 HF 最热论文(153 upvotes)。完整拆解:OA/GR 双指标公式、六领域 21 类任务、四阶段数据构建、7 款模型实测——最强模型 OA 仅 37.8%,I2V 全面优于 T2V。
RMM 完整拆解:收缩维 TopK 列范数选择算法、minimax 最优性证明、retention-ratio 权衡;8 个基准 × 4 档保留比实测、注意力 vs MLP 不对称数据、A100 端到端 1.40× 加速。
SkillForge 完整拆解:strict-mask 合成 issue 四步流程、全局诊断/局部干预双层技能库、BM25+JIT 两阶段检索;SWE-bench Verified 72.2%(+5.8%)、Pro 34.1%(+5.8%)。