{
  "title": "Co-RL",
  "total": 1,
  "posts": [
    {
      "title": "论文精读：Co-RL——群体互评替代 RLHF：公式、机制与 7+4 基准实测",
      "url": "/posts/deep-read-co-rl/",
      "permalink": "https://hackcv.com/posts/deep-read-co-rl/",
      "date": "2026-08-23",
      "author": "hackcv",
      "description": "Co-RL 完整拆解：peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合；3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%，无标签追平监督，代码开源。",
      "categories": ["研究简报"],
      "tags": ["AI","强化学习","多智能体","Co-RL","论文精读"],
      "cover": "https://picsum.photos/seed/%E8%AE%BA%E6%96%87%E7%B2%BE%E8%AF%BBco-rl%E7%BE%A4%E4%BD%93%E4%BA%92%E8%AF%84%E6%9B%BF%E4%BB%A3-rlhf%E5%85%AC%E5%BC%8F%E6%9C%BA%E5%88%B6%E4%B8%8E-7\u0026#43;4-%E5%9F%BA%E5%87%86%E5%AE%9E%E6%B5%8B/1200/675",
      "readingTime": 1
    }
  ]
}
