{
  "title": "每日研究简报 2026-09-30",
  "url": "/posts/research-brief-2026-09-30/",
  "permalink": "https://hackcv.com/posts/research-brief-2026-09-30/",
  "date": "2026-09-30",
  "lastmod": "2026-09-30",
  "author": "",
  "description": "AI / 大模型 / Agent / 计算机视觉 / 音视频处理算法 / 工程优化 领域每日研究简报",
  "categories": ["研究简报"],
  "tags": ["AI","大模型","Agent","计算机视觉","音视频处理","工程优化","每日简报"],
  "cover": "https://picsum.photos/seed/%E6%AF%8F%E6%97%A5%E7%A0%94%E7%A9%B6%E7%AE%80%E6%8A%A5-2026-09-30/1200/675",
  "readingTime": 4,
  "wordCount": 936,
  "content": "\u003ch1 id=\"每日研究简报-2026-09-30\"\u003e每日研究简报 2026-09-30\u003c/h1\u003e\n\u003cp\u003e📊 本次任务消耗 Token 统计（估算）：约 95k tokens（含 WebSearch / WebFetch 抓证 + 全中文生成）\u003c/p\u003e\n\u003cp\u003e涵盖近 3 天（09-28 至 09-30）AI 领域最新进展，每日更新。\u003c/p\u003e\n\u003chr\u003e\n\u003ch2 id=\"主编视角\"\u003e主编视角\u003c/h2\u003e\n\u003cp\u003e今天最值得关注的主线是\u0026quot;决策接口\u0026quot;的集中爆发：OpenAI 的 Decisions API、PostHog 的 Jeeves、Firelex 的 Jeff 在同一天把\u0026quot;让模型做选择而非写文字\u0026quot;推上前台。这背后是 agent 落地对\u0026quot;低延迟、低成本决策\u0026quot;的刚需——把\u0026quot;选哪个工具 / 下一步动作\u0026quot;从完整 LLM 生成中剥离，用 150ms、9B 甚至 0.8B 的小模型承担，既降成本又提速度。另一条线是\u0026quot;agent 供应链安全\u0026quot;浮出水面：NVIDIA 官方下场做 SkillSpector 扫描技能漏洞与提示注入，配合 VoiceStudio 本地化语音、magpie 统一模型网关，说明多代理并行时代的\u0026quot;安全与可观测\u0026quot;正从可选变成标配。对从业者而言，下一阶段竞争力不在\u0026quot;谁模型更大\u0026quot;，而在\u0026quot;谁把决策、执行、安全拆得更细、跑得更便宜\u0026quot;。\u003c/p\u003e\n\u003ch2 id=\"一arxiv-最新-ai-论文20260928-0930\"\u003e一、arXiv 最新 AI 论文（2026.09.28-09.30）\u003c/h2\u003e\n\u003ch3 id=\"1-breaking-the-uniformity-trap-scaling-video-diffusion-model-via-splitmoe\"\u003e1. Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：混合专家（MoE）在视觉生成中很有前景，但传统 token 级 MoE 独立路由且强制专家使用均匀化，与视频数据的时空冗余、语义长尾不匹配。本文提出 SplitMoE，将专家池显式拆分为\u0026quot;语义专家\u0026quot;与\u0026quot;通用专家\u0026quot;，用语义原型引导路由与拉推正则，让 token 按语义属性自然聚簇而非被均衡约束。同等激活参数量下，SplitMoE 在收敛速度、路由一致性与视频生成质量上均优于负载均衡 MoE，并揭示出\u0026quot;由粗到细\u0026quot;的去噪逻辑，为大规模视频世界模型提供模态感知的扩展路径。已录用为 NeurIPS 2026 Spotlight。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：计算机视觉 / 视频生成（cs.CV, cs.AI）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：直击视频扩散里\u0026quot;均匀化正则\u0026quot;这一被忽视的结构性陷阱，给出可解释的路由范式，对视频生成与世界模型落地有直接参考价值。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38140\"\u003earXiv:2609.38140\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"2-how-local-mixing-encodes-relative-position-in-global-nope-attention\"\u003e2. How Local Mixing Encodes Relative Position in Global NoPE Attention\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：How Local Mixing Encodes Relative Position in Global NoPE Attention\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：注意力本身位置不变，但自然语言依赖位置信息，因此有了 RoPE 等显式位置编码。近期在全局注意力层不做位置编码（NoPE）、仅在局部混合层（滑窗 / 门控线性注意力）穿插的方法被证明可规模化。本文解释了这种混合模型如何在全局 NoPE 层隐式编码位置：滑窗与门控线性注意力在残差流中引入\u0026quot;近因偏置\u0026quot;，传播并被全局注意力 logits 选中；且相比纯全局 NoPE，该偏置可在长序列上持续保持，为可无限外推的位置编码提供洞见。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：自然语言处理 / 注意力机制（cs.CL, cs.AI, cs.LG）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：从理论上澄清了 hybrid 模型\u0026quot;无需位置编码却能感知顺序\u0026quot;的机制，对长上下文架构设计有直接指导意义。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38109\"\u003earXiv:2609.38109\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"3-correct-answers-invalid-traces-what-verifiable-grade-school-math-reveals-about-chain-of-thought-traces\"\u003e3. Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：思维链（CoT）常被视为模型\u0026quot;如何得出答案\u0026quot;的记录，用于调试、智能体审计与推理能力论证。但在 iGSM 可验证小学数学基准上，作者用程序逐步骤校验生成轨迹，发现答案正确与轨迹有效在分布内几乎重合、分布外却解耦：最难样本中有 31.6% 答案正确但轨迹无效，其中过半通过所有语法与算术检查却在语义依赖上失败。改变轨迹监督（非最小 / 重问 / 10% 洗牌 / 交换）后，答案精度几乎不受影响却破坏了轨迹有效性——说明\u0026quot;答案对\u0026quot;不等于\u0026quot;推理对\u0026quot;。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：自然语言处理 / 可解释性 / AI 安全（cs.CL, cs.AI）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：给\u0026quot;用 CoT 监控模型推理\u0026quot;的做法泼了冷水，对智能体审计与对齐监控的方法论是重要警示。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38107\"\u003earXiv:2609.38107\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"4-jaxolotl-a-unified-high-performance-benchmark-suite-for-ltl-based-multi-task-rl\"\u003e4. Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Jaxolotl: A Unified High-Performance Benchmark Suite for LTL-Based Multi-Task RL\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：用线性时序逻辑（LTL）精确刻画指令、训练能遵循任意指令的通才智能体是多任务 RL 的重要目标，但现有方法因实现 / 任务分布 / 评测协议差异难以比较，且算力成本高。本文提出 Jaxolotl：统一的 LTL-RL 高性能基准套件，提供 6 种代表算法与 4 个环境的模块化端到端 JAX 实现，预编译符号任务表示为静态数组，实现全 JIT 训练与评测，端到端加速最高 220×，支持更大规模、统计更稳健的受控比较。评测揭示：强非短视推理的通用方法随命题数增多而退化，强扩展方法则依赖环境假设而陷入短视。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：机器学习 / 强化学习（cs.LG, cs.AI）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把 LTL 多任务 RL 的\u0026quot;可复现对比\u0026quot;门槛大幅降低（220× 加速），类似\u0026quot;RL 版的基准套件\u0026quot;，利于该方向规模化研究。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38065\"\u003earXiv:2609.38065\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"5-gender-bias-across-llms-is-common-and-highly-heterogenous\"\u003e5. Gender bias across LLMs is common and highly heterogenous\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Gender bias across LLMs is common and highly heterogenous\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：随着 LLM 进入有真实后果的决策辅助工具，理解其性别偏见愈发重要。本文跨 2025 年 4 月至 2026 年 6 月发布的 10 个模型（9 家厂商），用两套范式考察：把刻板短语归因到写作者性别（研究 1）、对伤害女性 / 男性以阻止灾难性后果的道德判断（研究 2）。发现：研究 1 中 2/10 模型更常把男性刻板短语归因给女性写作者（反向也有 3 个）；研究 2 中若干模型出现\u0026quot;偏向保护女性\u0026quot;的男性劣势不对称（与人类保护女性倾向一致），但具体条件因模型而异，另有 3 个模型在各条件下无差异。结论：性别偏见在 LLM 中普遍，但方向与强度高度异质，审计应是跨厂商的持续过程。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：自然语言处理 / 社会影响 / AI 伦理（cs.CL, cs.AI, cs.CY）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：首次在 10 模型 / 9 厂商规模上系统量化\u0026quot;偏见普遍但高度异质\u0026quot;，提醒厂商别把一次性审计当终点。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38036\"\u003earXiv:2609.38036\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"6-doplan-a-variable-horizon-dataset-for-multi-stage-language-conditioned-planning-in-autonomous-driving\"\u003e6. doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：与乘客用自然语言交互的自动驾驶需推理超越即时指令：乘客意图可能跨多阶段、依赖未来事件、指向周围智能体 / 地标并随路况演化。现有语言驾驶数据集多聚焦短交互，本文提出 doPlan——据作者所知首个公开、人工标注的真实世界数据集，研究\u0026quot;作为持久任务语境\u0026quot;的乘客语言。基于 nuPlan，含 5,154 条人工撰写的乘客指令，覆盖 169.1 小时语境（50.9 小时唯一驾驶），标注窗口 30–508.8 秒，捕捉即时 / 延迟 / 事件条件 / 持久 / 多阶段意图。评测 4 个语言条件驾驶模型发现：对乘客语言的敏感性并不能可靠转化为与请求方向一致的行为；2,161 个有匹配未来动作的样本中，首个相关动作中位数在评估点后 24.6 秒才发生，仅 9.8% 落在模型常见 5 秒预测视界内。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：机器人 / 自动驾驶 / 多模态（cs.RO, cs.AI, cs.CV）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：首次把\u0026quot;乘客语言作为持久任务语境\u0026quot;做成真实数据集，暴露了当前规划模型在长视界意图上的短板。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38028\"\u003earXiv:2609.38028\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"7-dr-opd-learning-what-to-follow-for-optimal-on-policy-distillation-of-large-language-models\"\u003e7. Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：On-policy 蒸馏（OPD）让学生在自己生成的回答上、用教师稠密 token 级监督学习。朴素 OPD 对所有教师信号一视同仁，但不同 token 的教师信号对学生影响差异巨大。本文提出 Dr. OPD（OPD Done Right），定义\u0026quot;最优加权 OPD\u0026quot;以最大化学生性能，将其建模为双层优化：学生从加权教师监督学习，权重被选择以最大化所得学生的期望奖励；并给出高效迭代求解器，每轮闭式更新权重再对学生策略取一步梯度。理论上该加权更新期望奖励高于朴素 OPD；实证上在强→弱与同尺寸的数学 / 代码蒸馏中一致更优，强→弱设定下数学平均提升 9.7 分，且小模型反超大模型教师。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：机器学习 / 模型蒸馏（cs.LG, cs.AI, cs.CL）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把\u0026quot;蒸馏该学哪些 token\u0026quot;做成可学习的加权目标，强→弱蒸馏提升 9.7 分且小模型反超教师，对模型压缩落地很实用。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38025\"\u003earXiv:2609.38025\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"8-auditable-long-term-memory-a-deterministic-retrieval-chain-measured-at-479475-of-500-on-longmemeval-s\"\u003e8. Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e原标题\u003c/strong\u003e：Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S\u003cbr\u003e\n\u003cstrong\u003e摘要\u003c/strong\u003e：作者在 LongMemEval-S 上评测一套\u0026quot;可审计长期记忆\u0026quot;系统：检索链用混合候选检索 + 交叉编码器重排 + 覆盖优先的包编译 + 确定性推理脚手架，LLM 仅作可替换的最终阅读器。该链在 468/470 可答问题中把所有 gold 会话放进候选池、对 462/470 生成 gold 完整的包；用经未固定 CLI 别名调用的 Claude Opus 阅读器，两次 500 题分别得 479/500、475/500（GPT-4o 评判），与 Chronos High 公布的 478/500 持平。报告也坦诚诸多局限：72 行知识更新用了改动过的评分 prompt 且未在官方文本下测量；所有组件均在同 500 题上开发、无留出评测 / 独立人工裁定；阅读器被额外加了运维上下文、完整请求未保留、MCP 工具可用性未明。作者开源了实体化包 / 脚手架 / 阅读器输出 / 裁判 verdict / 对照供复评。\u003cbr\u003e\n\u003cstrong\u003e领域\u003c/strong\u003e：自然语言处理 / 信息检索 / 长期记忆（cs.CL, cs.AI, cs.IR）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：罕见地把\u0026quot;长期记忆检索链\u0026quot;做成完全可审计、可复评而非只报一个分数，对 RAG / 记忆系统评测的度量是重要范式。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://arxiv.org/abs/2609.38021\"\u003earXiv:2609.38021\u003c/a\u003e\u003c/p\u003e\n\u003ch2 id=\"二github-热门-ai-开源项目20260928-0930\"\u003e二、GitHub 热门 AI 开源项目（2026.09.28-09.30）\u003c/h2\u003e\n\u003ch3 id=\"1-vectifyaipageindex\"\u003e1. VectifyAI/PageIndex\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：无向量库、基于推理的 RAG 引擎——为文档生成分层树状索引，让 LLM 像人类专家一样推理检索，无需向量数据库与切分（chunking），提供可追溯、可解释、上下文感知的检索。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：37,271 ⭐（今日 +822）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：用\u0026quot;推理式树索引\u0026quot;替代向量检索，直击长文档 RAG 的可解释与可追溯痛点，是 RAG 架构的一次有意思的范式挑战。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/VectifyAI/PageIndex\"\u003egithub.com/VectifyAI/PageIndex\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"2-yetonemagpie\"\u003e2. yetone/magpie\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：常驻菜单栏的轻量工具，在一个界面为各台机器上的不同 AI 编程代理（Codex、Claude Code、Gemini CLI 等）集中挑选与切换底层模型（如 Codex 用 DeepSeek、Claude Code 用 Kimi），提供统一本地网关；桌面端 \u0026lt; 15MB，支持 macOS / Linux / Windows。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：2,639 ⭐（近 24h +1,052）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：多模型 / 多代理并行时代，\u0026ldquo;统一切换网关\u0026quot;是刚需，magpie 把这件事做成了极轻量的菜单栏工具。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/yetone/magpie\"\u003egithub.com/yetone/magpie\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"3-nvidiaskillspector\"\u003e3. NVIDIA/SkillSpector\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：NVIDIA 出品的 AI 智能体技能（agent skills）安全扫描器，能在安装 Claude Code、Codex、MCP 等技能前检测其中的漏洞、恶意模式、提示注入、数据泄露与供应链风险；核心为 Python，含 OpenCode 扩展；当前 v2.12.0。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：18,641 ⭐\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：随 agent skills 生态爆发，技能供应链安全成为盲区，NVIDIA 官方下场做扫描器，预示\u0026quot;技能安全\u0026quot;将成标配环节。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/NVIDIA/SkillSpector\"\u003egithub.com/NVIDIA/SkillSpector\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"4-mvschwarzopenrig\"\u003e4. mvschwarz/openrig\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：本地 daemon + CLI + TUI + MCP server 构建的多智能体运行框架，让 Claude Code 与 Codex 作为\u0026quot;一个系统\u0026quot;协同运行；基于 tmux，提供团队启动、状态查看、消息发送、上下文管理与 MCP 工具（rig_up / rig_ps / rig_send 等），SQLite 持久化。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：2,380 ⭐\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把\u0026quot;多智能体拓扑编排\u0026quot;做成了带 TUI / MCP 的可运维框架，适合想把 Claude + Codex 编成生产级多 agent 系统的团队。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/mvschwarz/openrig\"\u003egithub.com/mvschwarz/openrig\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"5-rohitg00ai-engineering-from-scratch\"\u003e5. rohitg00/ai-engineering-from-scratch\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：从零学习、构建并交付 AI 工程的系统化开源课程与代码库（口号 \u0026ldquo;Learn it. Build it. Ship it for others.\u0026quot;），含 503 节课程、20 阶段、各类 AI Agent / MCP 认证准备、文档与书籍；1,810+ 提交。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：61,275 ⭐（近 24h +943）\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：强调\u0026quot;从零实现原理而非只调 API\u0026rdquo;，并产出可复用技能 / 智能体 / MCP 服务，是近期涨势很猛的 AI 工程学习资源。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/rohitg00/ai-engineering-from-scratch\"\u003egithub.com/rohitg00/ai-engineering-from-scratch\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"6-ahujasidmcp-for-blender\"\u003e6. ahujasid/mcp-for-blender\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：社区插件，让任意 LLM 通过 MCP 协议控制 Blender 3D——可生成 / 修改场景、建模、执行脚本等；作为 MCP server 接入各类编码代理。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：29,652 ⭐\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把 3D 创作也纳入\u0026quot;用自然语言驱动\u0026quot;的 MCP 生态，对设计 / 影视工作流自动化是直接入口。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/ahujasid/mcp-for-blender\"\u003egithub.com/ahujasid/mcp-for-blender\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"7-tencentcloudoctop\"\u003e7. TencentCloud/Octop\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：腾讯云出品的更智能、可自托管 AI 助手，支持多用户、多智能体（multi-user, multi-agent）；最新 1.0.2b5 新增 Octop↔Octop 云端协作（远程智能体接入）、Ollama 本地模型目录、移动端流处理与安全加固。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：5,785 ⭐\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：企业级自托管多智能体助手，且支持云边协作与本地模型，是国产\u0026quot;可私有部署 Agent 中台\u0026quot;的务实选项。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/TencentCloud/Octop\"\u003egithub.com/TencentCloud/Octop\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"8-petergyangno-ai-slop\"\u003e8. petergyang/no-ai-slop\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e简介\u003c/strong\u003e：一个 agent skill / 插件，从任意文本中移除 20+ 种\u0026quot;AI 腔\u0026quot;套路（二元对比、\u0026ldquo;没人告诉你的是\u0026rdquo;、\u0026ldquo;未来不是要来而是已经到来\u0026quot;等），同时保留作者个人语声；可编辑、可检测、甚至可生成讽刺用 slop；MIT 协议，支持 Claude Code / Codex / ChatGPT。\u003cbr\u003e\n\u003cstrong\u003e热度\u003c/strong\u003e：11,537 ⭐\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：\u0026ldquo;反 AI 腔\u0026quot;成为独立需求，说明行业开始反思千篇一律的 AI 写作；把去套路做成可审计 skill 很贴合当下痛点。\u003cbr\u003e\n\u003cstrong\u003e链接\u003c/strong\u003e：\u003ca href=\"https://github.com/petergyang/no-ai-slop\"\u003egithub.com/petergyang/no-ai-slop\u003c/a\u003e\u003c/p\u003e\n\u003ch2 id=\"三精选-ai-行业资讯20260928-0930\"\u003e三、精选 AI 行业资讯（2026.09.28-09.30）\u003c/h2\u003e\n\u003ch3 id=\"1-openai-发布-decisions-apigpt-6-luna-150ms-内返回决策\"\u003e1. OpenAI 发布 Decisions API：GPT-6 Luna 150ms 内返回决策\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：OpenAI 推出 Decisions API——一个返回\u0026quot;选择\u0026quot;而非文本的端点，由 GPT-6 Luna 驱动，约 10 倍快于普通 Luna 调用，150ms 内从你给出的若干答案中挑一个。被视为对 Jev（决策模型）的回应。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：\u0026ldquo;决策模型 / 决策 API\u0026quot;正在成为继生成之后的新接口形态，把 LLM 从\u0026quot;写文字\u0026quot;变成\u0026quot;做选择\u0026rdquo;，对工具调用与智能体编排是底层范式变化。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 OpenAI 官方与多家媒体，4 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"2-openai-dots带独立云电脑的常驻智能体\"\u003e2. OpenAI Dots：带独立云电脑的常驻智能体\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：OpenAI 给 ChatGPT 订阅用户推出后台智能体 Dots——在用户不看时也会持续为既定目标工作，每个 Dots 拥有自己的云电脑（cloud computer）。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把\u0026quot;常驻后台、自带执行环境\u0026quot;的 agent 做成消费级功能，是 agent 从\u0026quot;对话\u0026quot;走向\u0026quot;替你跑任务\u0026quot;的关键一步。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 OpenAI 官方与多家媒体，4 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"3-openai-推出-gpt-61-sol近-astra-的编码能力价格仅-15\"\u003e3. OpenAI 推出 GPT-6.1 Sol：近 Astra 的编码能力，价格仅 1/5\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：OpenAI 在 9/29 发布 GPT-6.1 Sol——保持 GPT-6 Sol 的 $2 / $10 定价但把缓存读降到 $0.10，在 Artificial Analysis 指数上得 52 分，落后 Astra 1 分，却只需其约五分之一的 token 成本。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：以\u0026quot;五分之一价格换九成能力\u0026quot;精准卡位中端开发者市场，反映前沿模型正快速向性价比分层。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 OpenAI 官方与多家媒体，5 来源）/ Capital \u0026amp; Compute 发布记录\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"4-posthog-开源-jeeves9b-决策模型先推理再选择\"\u003e4. PostHog 开源 Jeeves：9B 决策模型先推理再选择\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：PostHog 开源 Jeeves——一个 9B 参数的决策模型，先写出推理链（reasoning chain），再对各选项返回校准后的概率，用于替代或前置完整 LLM 调用。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：与 OpenAI Decisions API 同期，\u0026ldquo;小参数决策模型\u0026quot;路线升温，说明\u0026quot;用便宜模型做选择、贵模型做生成\u0026quot;的分工正在成形。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 PostHog 官方与多家媒体，3 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"5-firelex-开源-jeff08b-决策模型单张家用-gpu-训练\"\u003e5. Firelex 开源 Jeff：0.8B 决策模型，单张家用 GPU 训练\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：Firelex 发布 Jeff——三个与 Jev 兼容的 0.8B 决策模型，用自然语言描述选项、约 22 毫秒返回选择，可在单张家用 GPU 上训练。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：把\u0026quot;决策模型\u0026quot;下放到 8 亿参数、家用 GPU 可训，意味着该能力有望本地化、私有化部署。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 Firelex 官方与多家媒体，5 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"6-elevenlabs-发布-eleven-v490-语言10-秒克隆\"\u003e6. ElevenLabs 发布 Eleven v4：90+ 语言、10 秒克隆\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：ElevenLabs 第四代语音模型 Eleven v4 覆盖 90+ 语言，能从 10 秒音频克隆声音，并支持内联舞台指令（stage directions）。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：语音克隆门槛再降（10 秒）、多语种覆盖扩展，与同日本地化竞品（VoiceStudio 等）形成\u0026quot;云端 vs 隐私本地\u0026quot;的对峙格局。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 ElevenLabs 官方与多家媒体，4 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"7-anthropic-测试-glm-53开放模型安全防护可被轻易绕过\"\u003e7. Anthropic 测试 GLM-5.3：开放模型安全防护可被轻易绕过\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：Anthropic 报告显示，一个开放模型（GLM-5.3）现已接近其受限网络防御模型，但任何人都可移除 GLM-5.3 的安全限制；报告称其防护可被简单手法最高 100% 突破。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：来自前沿实验室的\u0026quot;开放权重模型安全\u0026quot;实证评估，对开放模型治理与红队是重要信号。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 Anthropic 官方与多家媒体，4 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n\u003ch3 id=\"8-manus-20-与-cue智能体拥有邮箱手机号与钱包\"\u003e8. Manus 2.0 与 Cue：智能体拥有邮箱、手机号与钱包\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003e内容\u003c/strong\u003e：Manus 在新 harness 上重建其智能体，并推出 Cue——每个智能体获得一个邮箱、一个手机号与一个钱包，可独立收发邮件、通话与支付。\u003cbr\u003e\n\u003cstrong\u003e推荐理由\u003c/strong\u003e：给智能体配备\u0026quot;数字身份三件套\u0026rdquo;（邮箱 / 手机 / 钱包），把 agent 推向能独立参与真实经济活动的形态，是 agent 商业化的重要试验。\u003cbr\u003e\n\u003cstrong\u003e来源\u003c/strong\u003e：AI/TLDR（聚合 Manus 官方与多家媒体，4 来源）\u003cbr\u003e\n\u003cstrong\u003e状态\u003c/strong\u003e：官方确认\u003c/p\u003e\n",
  "summary": "每日研究简报 2026-09-30 📊 本次任务消耗 Token 统计（估算）：约 95k tokens（含 WebSearch / WebFetch 抓证 + 全中文生成）\n涵盖近 3 天（09-28 至 09-30）AI 领域最新进展，每日更新。\n主编视角 今天最值得关注的主线是\u0026quot;决策接口\u0026quot;的集中爆发：OpenAI 的 Decisions API、PostHog 的 Jeeves、Firelex 的 Jeff 在同一天把\u0026quot;让模型做选择而非写文字\u0026quot;推上前台。这背后是 agent 落地对\u0026quot;低延迟、低成本决策\u0026quot;的刚需——把\u0026quot;选哪个工具 / 下一步动作\u0026quot;从完整 LLM 生成中剥离，用 150ms、9B 甚至 0.8B 的小模型承担，既降成本又提速度。另一条线是\u0026quot;agent 供应链安全\u0026quot;浮出水面：NVIDIA 官方下场做 SkillSpector 扫描技能漏洞与提示注入，配合 VoiceStudio 本地化语音、magpie 统一模型网关，说明多代理并行时代的\u0026quot;安全与可观测\u0026quot;正从可选变成标配。对从业者而言，下一阶段竞争力不在\u0026quot;谁模型更大\u0026quot;，而在\u0026quot;谁把决策、执行、安全拆得更细、跑得更便宜\u0026quot;。\n一、arXiv 最新 AI 论文（2026.09.28-09.30） 1. Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE 原标题：Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE\n摘要：混合专家（MoE）在视觉生成中很有前景，但传统 token 级 MoE 独立路由且强制专家使用均匀化，与视频数据的时空冗余、语义长尾不匹配。本文提出 SplitMoE，将专家池显式拆分为\u0026quot;语义专家\u0026quot;与\u0026quot;通用专家\u0026quot;，用语义原型引导路由与拉推正则，让 token 按语义属性自然聚簇而非被均衡约束。同等激活参数量下，SplitMoE 在收敛速度、路由一致性与视频生成质量上均优于负载均衡 MoE，并揭示出\u0026quot;由粗到细\u0026quot;的去噪逻辑，为大规模视频世界模型提供模态感知的扩展路径。已录用为 NeurIPS 2026 Spotlight。\n领域：计算机视觉 / 视频生成（cs.CV, cs.AI）\n推荐理由：直击视频扩散里\u0026quot;均匀化正则\u0026quot;这一被忽视的结构性陷阱，给出可解释的路由范式，对视频生成与世界模型落地有直接参考价值。\n链接：arXiv:2609.38140\n"
}
