📑 目录
技术人视角 · 今日四栏精选:arXiv 论文 / GitHub 开源 / HuggingFace 热门 / 行业资讯。
一 · arXiv 最新论文
可编程世界模型
摘要:现在的视频世界模型能生成越来越逼真、可交互的视觉体验,但缺乏可靠的机制来维护持久的世界状态,也无法在长时间交互中执行可编程规则。这篇论文提出了可编程世界模型框架,把世界状态演化和视觉观察生成解耦开来。智能体可以把自然语言指令翻译成结构化规则,然后这些规则会在模拟环境中被强制执行。
领域:AI / 大模型
推荐理由:这个思路挺有意思的——让智能体自己定义世界规则,而不是写死在代码里,游戏和仿真领域可能会受益。
链接:http://arxiv.org/abs/2609.10540v1
IdeaAMBIG:研究想法规范中实现关键差距的基准测试
摘要:一个研究想法可能既新颖又科学合理,但提出的方法可能还不够具体,无法忠实实现。这篇论文研究了面向实现的研究方法规范的编码准备程度,定义是:是否为有能力的实现者或编码智能体提供了足够的方法信息来预期的方法。
领域:AI / 大模型
推荐理由:这个问题很实际——很多论文想法不错,但实现细节缺失,这个基准可以帮我们评估想法的可落地性。
链接:http://arxiv.org/abs/2609.10539v1
通过正则化流实现无似然推断
摘要:这篇论文提出了一种神经网络正则化流的简单分解方法,在有干扰参数的情况下自然地发现枢轴统计量(或接近枢轴的统计量),只需要从目标分布中采样即可。作者证明了这个统计量在最小平均KL散度意义上接近枢轴,并且可以用于构建有效的置信区间。
领域:AI / 大模型
推荐理由:统计推断和生成模型的交叉研究,做概率建模的同学可以看看。
链接:http://arxiv.org/abs/2609.10534v1
用测试时部分观测引导图像到3D生成
摘要:图像到3D模型可以从单张RGB图像生成视觉上令人印象深刻的3D资产,但它们的几何形状通常只受到可用观测的松散约束,限制了在需要几何保真度的应用中的使用。在许多现实世界场景中,测试时可能可以获得物体的部分几何观测。这篇论文提出了一个无需训练的框架,用于在推理时整合这些部分观测。
领域:AI / 大模型
推荐理由:做3D生成或NeRF的同学可以看看,这篇论文解决了测试时部分观测的问题。
链接:http://arxiv.org/abs/2609.10531v1
间隙-熵猜想的正向证明
摘要:这篇论文证明了固定置信度最优臂识别中的间隙-熵猜想,场景是独立单位方差高斯臂,均值在[0,1]区间,且有唯一最优臂。对于每个次优臂i,定义Δ_i=μ_*-μ_i为与最优均值的间隙,H=ΣΔ_i^{-2}。论文证明了当间隙分布满足特定条件时,可以达到最优的样本复杂度下界。
领域:AI / 大模型
推荐理由:强化学习理论的硬核论文,证明了多臂老虎机问题的一个重要猜想。
链接:http://arxiv.org/abs/2609.10529v1
极限语言生成的特征:有限见证者与分离宽度层次
摘要:极限语言生成问的是:对于未知无限语言的每个穷举正向表示,能否生成有效的未见过元素?这篇论文对任意可数宇宙上的任意族刻画了这个任务。生成是可能的,当且仅当每个目标可以被分配一个有限正向见证者,使得任何有限样本激活的目标具有无限公共交集。
领域:AI / 大模型
推荐理由:形式语言理论和机器学习交叉的研究,做理论计算机科学的同学可以看看。
链接:http://arxiv.org/abs/2609.10525v1
基于Stacking集成学习的稻米品种精确分类
摘要:稻米是全球人口的主食,品种多样性很高,给消费者、贸易商和农民的准确识别带来了很大挑战。这种复杂性常常导致欺诈行为,比如未经授权混合稻米类型,损害了供应链的质量和信誉。尽管这个问题很重要,但现有的方法在识别精度上还有很大提升空间。
领域:AI / 大模型
推荐理由:农业AI的应用案例,用集成学习解决实际的分类问题。
链接:http://arxiv.org/abs/2609.10524v1
Show-Harness:只用VLM智能体就能操控机器人
摘要:基础视觉语言模型(VLMs)对世界有广泛的理解,但要把这种理解转化为机器人控制仍然很有挑战性。这篇论文提出了Show-Harness,一个具身接口,让VLMs能够通过一个紧凑的语义接口来"玩"机器人,这个接口把意图映射到动作。Show-Harness暴露了离散的语义动作单元,VLMs可以自然地推理这些单元。
领域:AI / 大模型
推荐理由:做机器人或具身智能的朋友可以看看这篇论文,用VLM直接控制机器人是个有趣的方向。
链接:http://arxiv.org/abs/2609.10522v1
二 · GitHub 热门开源
openclaw/openclaw
简介:真正做事的AI。任何操作系统,任何平台。龙虾方式。
热度:389333⭐
推荐理由:38万星不是盖的,主打"真正做事的AI",跨平台执行能力确实是个亮点。
链接:https://github.com/openclaw/openclaw
obra/superpowers
简介:一个能用的Agent技能框架和软件开发方法论。
热度:284386⭐
推荐理由:28万星的Agent技能框架,技能系统的设计思路值得学习,特别是如何让Agent动态加载新能力。
链接:https://github.com/obra/superpowers
NousResearch/hermes-agent
简介:跟你一起成长的Agent。
热度:244062⭐
推荐理由:NousResearch出的Agent,主打"成长性",可以持续学习用户的习惯和偏好。
链接:https://github.com/NousResearch/hermes-agent
n8n-io/n8n
简介:公平代码的工作流自动化平台,原生AI能力。可视化搭建+自定义代码,自托管或云端,400+集成。
热度:203913⭐
推荐理由:工作流自动化的老牌选手,现在加了AI能力,适合做内部工具的团队。
链接:https://github.com/n8n-io/n8n
Significant-Gravitas/AutoGPT
简介:AutoGPT是人人可用、人人可建的AI愿景。我们的使命是提供工具,让你专注于重要的事。
热度:187243⭐
推荐理由:AutoGPT的最新版本,18万星的老牌项目,可以看看它最近的更新。
链接:https://github.com/Significant-Gravitas/AutoGPT
firecrawl/firecrawl
简介:大规模搜索、抓取和与网页交互的上下文API。
热度:178613⭐
推荐理由:做RAG或需要网页数据的朋友可以看看,这个项目专门解决大规模网页抓取问题。
链接:https://github.com/firecrawl/firecrawl
f/prompts.chat
简介:原名Awesome ChatGPT Prompts。分享、发现和收集社区提示词。免费开源——可自托管,完全隐私。
热度:169851⭐
推荐理由:提示词工程的社区宝库,想找好用的prompt可以直接来这里抄作业。
链接:https://github.com/f/prompts.chat
Snailclimb/JavaGuide
简介:Java 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发
热度:158423⭐
推荐理由:10万星的成熟项目,质量有保证。
链接:https://github.com/Snailclimb/JavaGuide
三 · HuggingFace 热门
📄 Daily Papers 精选
Show-Harness:只用VLM智能体就能操控机器人
摘要:基础视觉语言模型(VLMs)对世界有广泛的理解,但要把这种理解转化为机器人控制仍然很有挑战性。这篇论文提出了Show-Harness,一个具身接口,让VLMs能够通过一个紧凑的语义接口来"玩"机器人,这个接口把意图映射到动作。
热度:50⬆
GitHub:https://github.com/showlab/Show-Harness
链接:https://huggingface.co/papers/2609.10522
可编程世界模型
摘要:现在的视频世界模型能生成越来越逼真、可交互的视觉体验,但缺乏可靠的机制来维护持久的世界状态,也无法在长时间交互中执行可编程规则。这篇论文提出了可编程世界模型框架,把世界状态演化和视觉观察生成解耦开来。
热度:39⬆
GitHub:https://github.com/AlayaLab/pwm
链接:https://huggingface.co/papers/2609.10540
AgentGrad:多智能体系统的干预引导提示优化
摘要:基于大语言模型的多智能体系统通过使用专门的多个智能体来实现强大的性能,但它们的性能依赖于每个智能体的提示设计。对于多智能体系统的提示优化,使用自然语言反馈来指导提示更新的文本梯度方法很有前景,但面临着探索效率低下和缺乏方向指导的挑战。
热度:27⬆
链接:https://huggingface.co/papers/2609.08572
WearableQA:基于真实可穿戴数据的健康推理基准
摘要:可穿戴传感器的进步使得持续监测生理和行为信号成为可能,但现有基准很少评估AI系统能否对真实用户的长期可穿戴记录进行推理。这篇论文介绍了WearableQA,一个包含4084道10选1选择题的基准,数据来自200名用户的可穿戴时间序列、血液生物标志物和人口统计信息。
热度:26⬆
GitHub:https://github.com/facebookresearch/WearableQA
链接:https://huggingface.co/papers/2609.05405
SWE-Bench Pro Verified:软件工程智能体的可靠基准
摘要:SWE-Bench Pro已经成为评估软件工程智能体在具有挑战性的仓库级任务上的标准基准。然而,我们的分析表明,它的评估受到两个不可靠来源的破坏:奖励黑客(由金标准解决方案泄露或隐藏评估标准启用)和环境差异。
热度:17⬆
链接:https://huggingface.co/papers/2609.08149
📝 HuggingFace Blog
用Gradio Workflow重建AUTOMATIC1111
摘要:用Gradio Workflow重建AUTOMATIC1111
链接:https://huggingface.co/blog/gradio-workflow-1111
IBM发布SOTA Granite时序模型PatchTST-FM-r2,采用商业友好许可证
摘要:IBM发布SOTA Granite时序模型PatchTST-FM-r2,采用商业友好许可证
链接:https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-series
安全为谁?拒绝话题的正确子集,而非整个话题
摘要:安全为谁?拒绝话题的正确子集,而非整个话题
链接:https://huggingface.co/blog/MultiverseComputingCAI/safety-for-whom
四 · 行业资讯
全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口
内容:9月10日,阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。
推荐理由:高德做城市级世界模型,这个野心不小,看看能落地到什么程度。
来源:量子位
全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源
内容:大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R
推荐理由:从人类视频中学习机器人技能,这个思路很有前景,数据来源问题解决了一大半。
来源:量子位
AGI时代的第一个生图模型,ChatGPT Images 2.5上线
内容:主打生成更快,细节更好,改图也终于越来越像"真·修图"了。
推荐理由:OpenAI在图像生成上又进一步,“真·修图"这个定位挺有意思。
来源:量子位
一周连发6个模型!这家公司把具身智能的闭环跑通了
内容:模型可以开源,部署经验不能
推荐理由:一周6个模型,这节奏很快,看看他们是怎么跑通闭环的。
来源:量子位
11家Coding平台首同场、近七成参赛者未满18岁,AI Coding第一次有了“全民样本”
内容:9月9日,外滩大会现场诞生一项新的吉尼斯世界纪录。 外滩黑客松·AI Coding大赛完成吉尼斯世界纪录认证,以AI应用作品数创造“线上生成式人工智能编程马拉松大赛中开发最多的应用”这一新纪录,成为国内首个以AI Coding为主题挑战世界纪录的赛事。赛事吸引上万名参赛者,共完成万件AI应用作品,其中近七成参赛者未满18岁,最小参赛者仅6岁,最终由一名9岁选手夺得冠军。 本届大赛由外滩大会组委会发起,联合小红书、观猹共同主办,国内十余个头部AI Coding平台共同承办。在颁奖现场,11家头部AI Coding平台也共同发布《AI Coding公开挑战赛技术规范》,将大规模赛事实践沉淀为行业规范。全民Coding时代,这也是国内首份由多家AI Coding平台共同制定的公开挑战赛技术规范。 当上万人开始用AI把想法变成应用,“全民Coding”第一
推荐理由:9岁夺冠、7成未成年,AI Coding的普及速度比想象中快多了。
来源:雷锋网 AI
GPT-6 Astra: The next generation in intelligence for work
内容:Meet GPT-6 Astra, OpenAI’s most capable model for business, with advanced reasoning, computer use, and stronger writing and design judgment.
推荐理由:OpenAI发布新一代模型,主打工作场景,看看有什么新能力。
来源:OpenAI Blog
从Demo到1000万次真实作业,万勋发布NOVA2.0柔性具身大脑
内容:作为柔性具身智能的全球领航者,万勋科技于日前正式发布其第二代柔性具身大脑NOVA2.0(Neuromorphic Omniversal Versatile Architecture,神经元智能开放世界通用架构),同时也是行业首个开放世界全天候商业交付级具身智能架构——该架构脱胎并服务于40+真实行业场景超1000万次多维度极限工况作业,跨行业场景迁移、落地能力与应用价值已赢得全球客户广泛认可,并从中构建起极为稀缺的真实场景数据飞轮,为行业率先跑通了"真场景、真需求、真数据、真落地"的具身智能技术路线,宣告了具身智能已跃过开放世界应用分水岭。 <img src=“https://static.leiphone.com/uploads/new/images/20260909/6aa10a074591c.png?image
推荐理由:1000万次真实作业,这个数据量级很有说服力,具身智能落地的关键就是真场景数据。
来源:雷锋网 AI
具身机器人能搞定超市盘点吗?全球七万门店正在给出答案
内容:从Demo到货架,这两家公司要让具身智能算得过账
推荐理由:具身智能落地的真实案例,从实验室走向商超,看看他们怎么解决实际问题。
来源:量子位
本次任务消耗Token统计:脚本化模式(opencode 启动,无独立 token 计量)
参与讨论
评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。评论由 GitHub Discussions 驱动,数据存储于 hackcv/blog 仓库;需要 GitHub 账号登录后参与,支持 Markdown 与表情回应。