TERM · 研究简报
研究简报
论文精读
论文精读:Co-RL——群体互评替代 RLHF:公式、机制与 7+4 基准实测
Co-RL 完整拆解:peer-reward 伪标签公式、环状拓扑多数投票、群体多样性三维度、GRPO 结合;3B 模型 7 基准平均 +8.6%、VLM 4 基准 +7.2%,无标签追平监督,代码开源。
论文精读
论文精读:SemComp-Bench——视频生成评测从「像不像」走向「做没做成」
本周 HF 最热论文(153 upvotes)。完整拆解:OA/GR 双指标公式、六领域 21 类任务、四阶段数据构建、7 款模型实测——最强模型 OA 仅 37.8%,I2V 全面优于 T2V。
性能优化
实践:纯 CPU 图片擦除三模型实测——LaMa / MI-GAN / Telea 的选型与工程细节
Intel Mac 纯 CPU + ONNX Runtime 实测 LaMa/MI-GAN/Telea:速度恒定特性、crop vs resize 策略、掩码膨胀羽化,以及三档选型矩阵——全部真实测量。
代码验证
实践:文字与马赛克自动擦除 + 画质增强——一条 CPU 上的完整图像处理流水线
PP-OCRv4 DBNet 文字检测 + 纯 CV 马赛克检测 + 多来源掩码 OR 合并 + LaMa 擦除,再接「分析→修复→放大→精修」画质增强四阶段,全程 CPU;含色彩保真踩坑实录。
算法解读
算法解读:RMM——TopK 列范数切片:公式、1B~70B 实测与注意力/MLP 不对称性
RMM 完整拆解:收缩维 TopK 列范数选择算法、minimax 最优性证明、retention-ratio 权衡;8 个基准 × 4 档保留比实测、注意力 vs MLP 不对称数据、A100 端到端 1.40× 加速。
算法解读
算法解读:SkillForge——四步合成 issue + 双层技能库,SWE-bench 实测 +5.8%
SkillForge 完整拆解:strict-mask 合成 issue 四步流程、全局诊断/局部干预双层技能库、BM25+JIT 两阶段检索;SWE-bench Verified 72.2%(+5.8%)、Pro 34.1%(+5.8%)。
每日简报
每日研究简报 2026-03-26
📄 arXiv 最新论文(Top 5) 1. UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual …