📑 目录

📊 本次任务消耗 Token 统计(估算):约 95k tokens(含 WebSearch / WebFetch 抓证 + 全中文生成)

涵盖近 3 天(09-28 至 09-30)AI 领域最新进展,每日更新。


主编视角

今天最值得关注的主线是"决策接口"的集中爆发:OpenAI 的 Decisions API、PostHog 的 Jeeves、Firelex 的 Jeff 在同一天把"让模型做选择而非写文字"推上前台。这背后是 agent 落地对"低延迟、低成本决策"的刚需——把"选哪个工具 / 下一步动作"从完整 LLM 生成中剥离,用 150ms、9B 甚至 0.8B 的小模型承担,既降成本又提速度。另一条线是"agent 供应链安全"浮出水面:NVIDIA 官方下场做 SkillSpector 扫描技能漏洞与提示注入,配合 VoiceStudio 本地化语音、magpie 统一模型网关,说明多代理并行时代的"安全与可观测"正从可选变成标配。对从业者而言,下一阶段竞争力不在"谁模型更大",而在"谁把决策、执行、安全拆得更细、跑得更便宜"。

一、arXiv 最新 AI 论文(2026.09.28-09.30)

1. Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

原标题:Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
摘要:混合专家(MoE)在视觉生成中很有前景,但传统 token 级 MoE 独立路由且强制专家使用均匀化,与视频数据的时空冗余、语义长尾不匹配。本文提出 SplitMoE,将专家池显式拆分为"语义专家"与"通用专家",用语义原型引导路由与拉推正则,让 token 按语义属性自然聚簇而非被均衡约束。同等激活参数量下,SplitMoE 在收敛速度、路由一致性与视频生成质量上均优于负载均衡 MoE,并揭示出"由粗到细"的去噪逻辑,为大规模视频世界模型提供模态感知的扩展路径。已录用为 NeurIPS 2026 Spotlight。
领域:计算机视觉 / 视频生成(cs.CV, cs.AI)
推荐理由:直击视频扩散里"均匀化正则"这一被忽视的结构性陷阱,给出可解释的路由范式,对视频生成与世界模型落地有直接参考价值。
链接:arXiv:2609.38140

2. How Local Mixing Encodes Relative Position in Global NoPE Attention

原标题:How Local Mixing Encodes Relative Position in Global NoPE Attention
摘要:注意力本身位置不变,但自然语言依赖位置信息,因此有了 RoPE 等显式位置编码。近期在全局注意力层不做位置编码(NoPE)、仅在局部混合层(滑窗 / 门控线性注意力)穿插的方法被证明可规模化。本文解释了这种混合模型如何在全局 NoPE 层隐式编码位置:滑窗与门控线性注意力在残差流中引入"近因偏置",传播并被全局注意力 logits 选中;且相比纯全局 NoPE,该偏置可在长序列上持续保持,为可无限外推的位置编码提供洞见。
领域:自然语言处理 / 注意力机制(cs.CL, cs.AI, cs.LG)
推荐理由:从理论上澄清了 hybrid 模型"无需位置编码却能感知顺序"的机制,对长上下文架构设计有直接指导意义。
链接:arXiv:2609.38109

3. Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces

原标题:Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces
摘要:思维链(CoT)常被视为模型"如何得出答案"的记录,用于调试、智能体审计与推理能力论证。但在 iGSM 可验证小学数学基准上,作者用程序逐步骤校验生成轨迹,发现答案正确与轨迹有效在分布内几乎重合、分布外却解耦:最难样本中有 31.6% 答案正确但轨迹无效,其中过半通过所有语法与算术检查却在语义依赖上失败。改变轨迹监督(非最小 / 重问 / 10% 洗牌 / 交换)后,答案精度几乎不受影响却破坏了轨迹有效性——说明"答案对"不等于"推理对"。
领域:自然语言处理 / 可解释性 / AI 安全(cs.CL, cs.AI)
推荐理由:给"用 CoT 监控模型推理"的做法泼了冷水,对智能体审计与对齐监控的方法论是重要警示。
链接:arXiv:2609.38107

4. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL

原标题:Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL
摘要:用线性时序逻辑(LTL)精确刻画指令、训练能遵循任意指令的通才智能体是多任务 RL 的重要目标,但现有方法因实现 / 任务分布 / 评测协议差异难以比较,且算力成本高。本文提出 Jaxolotl:统一的 LTL-RL 高性能基准套件,提供 6 种代表算法与 4 个环境的模块化端到端 JAX 实现,预编译符号任务表示为静态数组,实现全 JIT 训练与评测,端到端加速最高 220×,支持更大规模、统计更稳健的受控比较。评测揭示:强非短视推理的通用方法随命题数增多而退化,强扩展方法则依赖环境假设而陷入短视。
领域:机器学习 / 强化学习(cs.LG, cs.AI)
推荐理由:把 LTL 多任务 RL 的"可复现对比"门槛大幅降低(220× 加速),类似"RL 版的基准套件",利于该方向规模化研究。
链接:arXiv:2609.38065

5. Gender bias across LLMs is common and highly heterogenous

原标题:Gender bias across LLMs is common and highly heterogenous
摘要:随着 LLM 进入有真实后果的决策辅助工具,理解其性别偏见愈发重要。本文跨 2025 年 4 月至 2026 年 6 月发布的 10 个模型(9 家厂商),用两套范式考察:把刻板短语归因到写作者性别(研究 1)、对伤害女性 / 男性以阻止灾难性后果的道德判断(研究 2)。发现:研究 1 中 2/10 模型更常把男性刻板短语归因给女性写作者(反向也有 3 个);研究 2 中若干模型出现"偏向保护女性"的男性劣势不对称(与人类保护女性倾向一致),但具体条件因模型而异,另有 3 个模型在各条件下无差异。结论:性别偏见在 LLM 中普遍,但方向与强度高度异质,审计应是跨厂商的持续过程。
领域:自然语言处理 / 社会影响 / AI 伦理(cs.CL, cs.AI, cs.CY)
推荐理由:首次在 10 模型 / 9 厂商规模上系统量化"偏见普遍但高度异质",提醒厂商别把一次性审计当终点。
链接:arXiv:2609.38036

6. doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving

原标题:doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving
摘要:与乘客用自然语言交互的自动驾驶需推理超越即时指令:乘客意图可能跨多阶段、依赖未来事件、指向周围智能体 / 地标并随路况演化。现有语言驾驶数据集多聚焦短交互,本文提出 doPlan——据作者所知首个公开、人工标注的真实世界数据集,研究"作为持久任务语境"的乘客语言。基于 nuPlan,含 5,154 条人工撰写的乘客指令,覆盖 169.1 小时语境(50.9 小时唯一驾驶),标注窗口 30–508.8 秒,捕捉即时 / 延迟 / 事件条件 / 持久 / 多阶段意图。评测 4 个语言条件驾驶模型发现:对乘客语言的敏感性并不能可靠转化为与请求方向一致的行为;2,161 个有匹配未来动作的样本中,首个相关动作中位数在评估点后 24.6 秒才发生,仅 9.8% 落在模型常见 5 秒预测视界内。
领域:机器人 / 自动驾驶 / 多模态(cs.RO, cs.AI, cs.CV)
推荐理由:首次把"乘客语言作为持久任务语境"做成真实数据集,暴露了当前规划模型在长视界意图上的短板。
链接:arXiv:2609.38028

7. Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models

原标题:Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models
摘要:On-policy 蒸馏(OPD)让学生在自己生成的回答上、用教师稠密 token 级监督学习。朴素 OPD 对所有教师信号一视同仁,但不同 token 的教师信号对学生影响差异巨大。本文提出 Dr. OPD(OPD Done Right),定义"最优加权 OPD"以最大化学生性能,将其建模为双层优化:学生从加权教师监督学习,权重被选择以最大化所得学生的期望奖励;并给出高效迭代求解器,每轮闭式更新权重再对学生策略取一步梯度。理论上该加权更新期望奖励高于朴素 OPD;实证上在强→弱与同尺寸的数学 / 代码蒸馏中一致更优,强→弱设定下数学平均提升 9.7 分,且小模型反超大模型教师。
领域:机器学习 / 模型蒸馏(cs.LG, cs.AI, cs.CL)
推荐理由:把"蒸馏该学哪些 token"做成可学习的加权目标,强→弱蒸馏提升 9.7 分且小模型反超教师,对模型压缩落地很实用。
链接:arXiv:2609.38025

8. Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S

原标题:Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S
摘要:作者在 LongMemEval-S 上评测一套"可审计长期记忆"系统:检索链用混合候选检索 + 交叉编码器重排 + 覆盖优先的包编译 + 确定性推理脚手架,LLM 仅作可替换的最终阅读器。该链在 468/470 可答问题中把所有 gold 会话放进候选池、对 462/470 生成 gold 完整的包;用经未固定 CLI 别名调用的 Claude Opus 阅读器,两次 500 题分别得 479/500、475/500(GPT-4o 评判),与 Chronos High 公布的 478/500 持平。报告也坦诚诸多局限:72 行知识更新用了改动过的评分 prompt 且未在官方文本下测量;所有组件均在同 500 题上开发、无留出评测 / 独立人工裁定;阅读器被额外加了运维上下文、完整请求未保留、MCP 工具可用性未明。作者开源了实体化包 / 脚手架 / 阅读器输出 / 裁判 verdict / 对照供复评。
领域:自然语言处理 / 信息检索 / 长期记忆(cs.CL, cs.AI, cs.IR)
推荐理由:罕见地把"长期记忆检索链"做成完全可审计、可复评而非只报一个分数,对 RAG / 记忆系统评测的度量是重要范式。
链接:arXiv:2609.38021

二、GitHub 热门 AI 开源项目(2026.09.28-09.30)

1. VectifyAI/PageIndex

简介:无向量库、基于推理的 RAG 引擎——为文档生成分层树状索引,让 LLM 像人类专家一样推理检索,无需向量数据库与切分(chunking),提供可追溯、可解释、上下文感知的检索。
热度:37,271 ⭐(今日 +822)
推荐理由:用"推理式树索引"替代向量检索,直击长文档 RAG 的可解释与可追溯痛点,是 RAG 架构的一次有意思的范式挑战。
链接:github.com/VectifyAI/PageIndex

2. yetone/magpie

简介:常驻菜单栏的轻量工具,在一个界面为各台机器上的不同 AI 编程代理(Codex、Claude Code、Gemini CLI 等)集中挑选与切换底层模型(如 Codex 用 DeepSeek、Claude Code 用 Kimi),提供统一本地网关;桌面端 < 15MB,支持 macOS / Linux / Windows。
热度:2,639 ⭐(近 24h +1,052)
推荐理由:多模型 / 多代理并行时代,“统一切换网关"是刚需,magpie 把这件事做成了极轻量的菜单栏工具。
链接:github.com/yetone/magpie

3. NVIDIA/SkillSpector

简介:NVIDIA 出品的 AI 智能体技能(agent skills)安全扫描器,能在安装 Claude Code、Codex、MCP 等技能前检测其中的漏洞、恶意模式、提示注入、数据泄露与供应链风险;核心为 Python,含 OpenCode 扩展;当前 v2.12.0。
热度:18,641 ⭐
推荐理由:随 agent skills 生态爆发,技能供应链安全成为盲区,NVIDIA 官方下场做扫描器,预示"技能安全"将成标配环节。
链接:github.com/NVIDIA/SkillSpector

4. mvschwarz/openrig

简介:本地 daemon + CLI + TUI + MCP server 构建的多智能体运行框架,让 Claude Code 与 Codex 作为"一个系统"协同运行;基于 tmux,提供团队启动、状态查看、消息发送、上下文管理与 MCP 工具(rig_up / rig_ps / rig_send 等),SQLite 持久化。
热度:2,380 ⭐
推荐理由:把"多智能体拓扑编排"做成了带 TUI / MCP 的可运维框架,适合想把 Claude + Codex 编成生产级多 agent 系统的团队。
链接:github.com/mvschwarz/openrig

5. rohitg00/ai-engineering-from-scratch

简介:从零学习、构建并交付 AI 工程的系统化开源课程与代码库(口号 “Learn it. Build it. Ship it for others."),含 503 节课程、20 阶段、各类 AI Agent / MCP 认证准备、文档与书籍;1,810+ 提交。
热度:61,275 ⭐(近 24h +943)
推荐理由:强调"从零实现原理而非只调 API”,并产出可复用技能 / 智能体 / MCP 服务,是近期涨势很猛的 AI 工程学习资源。
链接:github.com/rohitg00/ai-engineering-from-scratch

6. ahujasid/mcp-for-blender

简介:社区插件,让任意 LLM 通过 MCP 协议控制 Blender 3D——可生成 / 修改场景、建模、执行脚本等;作为 MCP server 接入各类编码代理。
热度:29,652 ⭐
推荐理由:把 3D 创作也纳入"用自然语言驱动"的 MCP 生态,对设计 / 影视工作流自动化是直接入口。
链接:github.com/ahujasid/mcp-for-blender

7. TencentCloud/Octop

简介:腾讯云出品的更智能、可自托管 AI 助手,支持多用户、多智能体(multi-user, multi-agent);最新 1.0.2b5 新增 Octop↔Octop 云端协作(远程智能体接入)、Ollama 本地模型目录、移动端流处理与安全加固。
热度:5,785 ⭐
推荐理由:企业级自托管多智能体助手,且支持云边协作与本地模型,是国产"可私有部署 Agent 中台"的务实选项。
链接:github.com/TencentCloud/Octop

8. petergyang/no-ai-slop

简介:一个 agent skill / 插件,从任意文本中移除 20+ 种"AI 腔"套路(二元对比、“没人告诉你的是”、“未来不是要来而是已经到来"等),同时保留作者个人语声;可编辑、可检测、甚至可生成讽刺用 slop;MIT 协议,支持 Claude Code / Codex / ChatGPT。
热度:11,537 ⭐
推荐理由:“反 AI 腔"成为独立需求,说明行业开始反思千篇一律的 AI 写作;把去套路做成可审计 skill 很贴合当下痛点。
链接:github.com/petergyang/no-ai-slop

三、精选 AI 行业资讯(2026.09.28-09.30)

1. OpenAI 发布 Decisions API:GPT-6 Luna 150ms 内返回决策

内容:OpenAI 推出 Decisions API——一个返回"选择"而非文本的端点,由 GPT-6 Luna 驱动,约 10 倍快于普通 Luna 调用,150ms 内从你给出的若干答案中挑一个。被视为对 Jev(决策模型)的回应。
推荐理由:“决策模型 / 决策 API"正在成为继生成之后的新接口形态,把 LLM 从"写文字"变成"做选择”,对工具调用与智能体编排是底层范式变化。
来源:AI/TLDR(聚合 OpenAI 官方与多家媒体,4 来源)
状态:官方确认

2. OpenAI Dots:带独立云电脑的常驻智能体

内容:OpenAI 给 ChatGPT 订阅用户推出后台智能体 Dots——在用户不看时也会持续为既定目标工作,每个 Dots 拥有自己的云电脑(cloud computer)。
推荐理由:把"常驻后台、自带执行环境"的 agent 做成消费级功能,是 agent 从"对话"走向"替你跑任务"的关键一步。
来源:AI/TLDR(聚合 OpenAI 官方与多家媒体,4 来源)
状态:官方确认

3. OpenAI 推出 GPT-6.1 Sol:近 Astra 的编码能力,价格仅 1/5

内容:OpenAI 在 9/29 发布 GPT-6.1 Sol——保持 GPT-6 Sol 的 $2 / $10 定价但把缓存读降到 $0.10,在 Artificial Analysis 指数上得 52 分,落后 Astra 1 分,却只需其约五分之一的 token 成本。
推荐理由:以"五分之一价格换九成能力"精准卡位中端开发者市场,反映前沿模型正快速向性价比分层。
来源:AI/TLDR(聚合 OpenAI 官方与多家媒体,5 来源)/ Capital & Compute 发布记录
状态:官方确认

4. PostHog 开源 Jeeves:9B 决策模型先推理再选择

内容:PostHog 开源 Jeeves——一个 9B 参数的决策模型,先写出推理链(reasoning chain),再对各选项返回校准后的概率,用于替代或前置完整 LLM 调用。
推荐理由:与 OpenAI Decisions API 同期,“小参数决策模型"路线升温,说明"用便宜模型做选择、贵模型做生成"的分工正在成形。
来源:AI/TLDR(聚合 PostHog 官方与多家媒体,3 来源)
状态:官方确认

5. Firelex 开源 Jeff:0.8B 决策模型,单张家用 GPU 训练

内容:Firelex 发布 Jeff——三个与 Jev 兼容的 0.8B 决策模型,用自然语言描述选项、约 22 毫秒返回选择,可在单张家用 GPU 上训练。
推荐理由:把"决策模型"下放到 8 亿参数、家用 GPU 可训,意味着该能力有望本地化、私有化部署。
来源:AI/TLDR(聚合 Firelex 官方与多家媒体,5 来源)
状态:官方确认

6. ElevenLabs 发布 Eleven v4:90+ 语言、10 秒克隆

内容:ElevenLabs 第四代语音模型 Eleven v4 覆盖 90+ 语言,能从 10 秒音频克隆声音,并支持内联舞台指令(stage directions)。
推荐理由:语音克隆门槛再降(10 秒)、多语种覆盖扩展,与同日本地化竞品(VoiceStudio 等)形成"云端 vs 隐私本地"的对峙格局。
来源:AI/TLDR(聚合 ElevenLabs 官方与多家媒体,4 来源)
状态:官方确认

7. Anthropic 测试 GLM-5.3:开放模型安全防护可被轻易绕过

内容:Anthropic 报告显示,一个开放模型(GLM-5.3)现已接近其受限网络防御模型,但任何人都可移除 GLM-5.3 的安全限制;报告称其防护可被简单手法最高 100% 突破。
推荐理由:来自前沿实验室的"开放权重模型安全"实证评估,对开放模型治理与红队是重要信号。
来源:AI/TLDR(聚合 Anthropic 官方与多家媒体,4 来源)
状态:官方确认

8. Manus 2.0 与 Cue:智能体拥有邮箱、手机号与钱包

内容:Manus 在新 harness 上重建其智能体,并推出 Cue——每个智能体获得一个邮箱、一个手机号与一个钱包,可独立收发邮件、通话与支付。
推荐理由:给智能体配备"数字身份三件套”(邮箱 / 手机 / 钱包),把 agent 推向能独立参与真实经济活动的形态,是 agent 商业化的重要试验。
来源:AI/TLDR(聚合 Manus 官方与多家媒体,4 来源)
状态:官方确认

参与讨论

评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。

评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。