{
  "title": "Daily Research Brief 2026-08-23",
  "url": "/en/posts/research-brief-2026-08-23/",
  "permalink": "https://hackcv.com/en/posts/research-brief-2026-08-23/",
  "date": "2026-08-23",
  "lastmod": "2026-08-23",
  "author": "",
  "description": "Daily research brief — AI / LLM / Agent / Computer Vision / Audio-Video / Engineering",
  "categories": ["Research Brief"],
  "tags": ["AI","LLM","Agent","Computer Vision","Audio-Video","Engineering","Daily Brief"],
  "cover": "https://picsum.photos/seed/daily-research-brief-2026-08-23/1200/675",
  "readingTime": 3,
  "wordCount": 716,
  "content": "\u003ch1 id=\"daily-research-brief-2026-08-23\"\u003eDaily Research Brief 2026-08-23\u003c/h1\u003e\n\u003cp\u003e📊 Token usage: estimated from retrieval and writing scale.\u003c/p\u003e\n\u003cp\u003eCovers the latest AI research, open source and industry moves, updated daily.\u003c/p\u003e\n\u003chr\u003e\n\u003ch2 id=\"editors-note\"\u003eEditor\u0026rsquo;s Note\u003c/h2\u003e\n\u003cp\u003eToday\u0026rsquo;s strong signal: \u0026ldquo;the agent race has formally shifted from model worship to systems engineering\u0026rdquo; — papers, open source and industry all point at the runtime layer around the model.\u003c/p\u003e\n\u003ch2 id=\"1-latest-arxiv-papers\"\u003e1. Latest arXiv Papers\u003c/h2\u003e\n\u003ch3 id=\"1-task-coevolve-efficient-harness-optimization-via-adaptive-validation-task-selection\"\u003e1. Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Harness optimization rewrites harness code to improve LLM agents without touching weights — but current methods re-run the full validation set every round even when tasks have lost discriminative power. Task-CoEvolve co-evolves the validation task set with the harness: variance-weighted sampling from history focuses the evaluation budget on the most divergent tasks, with a sampling-aware estimator recovering full-set scores from partial evaluation. Stable gains over fixed-subset baselines on online text classification and Terminal-Bench 2.1, matching full-set search\u0026rsquo;s final performance while cutting evaluation calls by \u003cstrong\u003e80%\u003c/strong\u003e during optimization.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.20169\"\u003ehttps://arxiv.org/abs/2608.20169\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"2-optimal-skill-selection-for-llm-agents-with-provable-bicriteria-guarantees\"\u003e2. Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Fitting reusable skill documents into a limited context window is the main way agents gain task capability — but current methods score skills independently and take top-k, with no quality guarantee and no token-cost awareness. This work gives the first model of \u0026ldquo;how a skill set determines execution outcome\u0026rdquo;, formalizes selection as maximizing monotone submodular reward minus context penalty under a hard token budget, and proposes BPS with a bicriteria (1−1/e, 1) approximation. On a contamination-controlled BigCodeBench variant, BPS hits 0.73 task success vs 0.20–0.52 for skill routers/text retrievers/self-selection, using \u003cstrong\u003e28% fewer tokens\u003c/strong\u003e than the strongest router.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.19993\"\u003ehttps://arxiv.org/abs/2608.19993\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"3-milegpo-milestone-inference-with-local-evidence-for-graph-based-policy-optimization-of-long-horizon-llm-agents\"\u003e3. MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Derives process-level credit for long-horizon agents via milestone inference with local evidence in graph-based policy optimization.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.19803\"\u003ehttps://arxiv.org/abs/2608.19803\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"4-harness-continual-learning-continual-adaptation-beyond-model-parameters\"\u003e4. Harness Continual Learning: Continual Adaptation Beyond Model Parameters\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Proposes \u0026ldquo;harness-level continual learning\u0026rdquo; — prompt/memory/skills keep drifting while the model is frozen, requiring each peripheral update to be regression-tested like a code commit.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.19013\"\u003ehttps://arxiv.org/abs/2608.19013\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"5-sapo-single-rollout-autoregressive-policy-optimization-for-agentic-reinforcement-learning\"\u003e5. SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: A single-rollout autoregressive policy optimization method sharing policy/value backbones, cutting sampling cost in agentic RL.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.19842\"\u003ehttps://arxiv.org/abs/2608.19842\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"6-rule-compliant-visual-spatial-planning-for-multimodal-large-language-models\"\u003e6. Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Visual spatial planning under explicit rule constraints (RuleMaze) for MLLMs.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.20237\"\u003ehttps://arxiv.org/abs/2608.20237\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"7-id-vtg-image-disambiguated-video-temporal-grounding\"\u003e7. ID-VTG: Image-Disambiguated Video Temporal Grounding\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: Image-plus-text disambiguated video temporal grounding — using both modalities to resolve timing ambiguities.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.20127\"\u003ehttps://arxiv.org/abs/2608.20127\u003c/a\u003e\u003c/p\u003e\n\u003ch3 id=\"8-4danyone-create-anyone-in-4d-from-a-casual-monocular-video\"\u003e8. 4DAnyone: Create Anyone in 4D from a Casual Monocular Video\u003c/h3\u003e\n\u003cp\u003e\u003cstrong\u003eAbstract\u003c/strong\u003e: 4D digital-human generation from a single monocular video with O(1) context compression.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eLink\u003c/strong\u003e: \u003ca href=\"https://arxiv.org/abs/2608.20335\"\u003ehttps://arxiv.org/abs/2608.20335\u003c/a\u003e\u003c/p\u003e\n\u003ch2 id=\"2-hot-github-open-source\"\u003e2. Hot GitHub Open Source\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eruvnet/ruflo\u003c/strong\u003e (68,940★) — orchestratable meta-harness for multi-agent swarms\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003emodular/modular\u003c/strong\u003e — modular\u0026rsquo;s agent runtime\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003emissuo/herdrm\u003c/strong\u003e — cross-device terminal control for parallel coding agents\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003ex64dbg-mcp-server\u003c/strong\u003e — debugger wired into MCP\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eaddyosmani/agent-skills\u003c/strong\u003e (80k★, Trending #2) — engineering experience as reusable skills\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eobra/superpowers\u003c/strong\u003e, \u003cstrong\u003epbakaus/impeccable\u003c/strong\u003e, \u003cstrong\u003ebook-to-skill\u003c/strong\u003e, \u003cstrong\u003espec-kit\u003c/strong\u003e, \u003cstrong\u003eheadroom\u003c/strong\u003e (context compression, 60–95% token cut)\u003c/li\u003e\n\u003c/ul\u003e\n\u003ch2 id=\"3-selected-industry-news\"\u003e3. Selected Industry News\u003c/h2\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eDeepSeek open-sources deepseek-harness\u003c/strong\u003e (\u0026ldquo;everything is a plugin\u0026rdquo;, 130k★ in 4 days)\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eOpenAI open-sources the agent runtime behind Codex\u003c/strong\u003e (Apache-2.0): \u0026ldquo;preserve reasoning traces + context compression\u0026rdquo; alone lifted GPT-5.6 Sol on ARC-AGI-3 from 13.3% to 38.3% with 1/6 the output tokens\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eNVIDIA AVO\u003c/strong\u003e: search strategy + persistent memory + stagnation monitoring took the same Claude Opus 5 from ~30% to a perfect score on ARC-AGI-3 public set (25/25, 100 RHAE), and produced GPU kernels up to 3.5% faster than cuDNN for 7 straight days\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eAnthropic GA\u003c/strong\u003e: Computer Use / Browser Use / Skills API / Files API all general availability\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003ePricing\u003c/strong\u003e: DeepSeek weekend valley pricing from 08-23; OpenAI GPT-5.6 Sol API \u0026gt;20% cut (output $30→$20, −33%); Gemini 3.7 Flash ~half price\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eModel releases\u003c/strong\u003e: DeepSeek V3.1 (hybrid reasoning, 128K, Anthropic-API compatible), V4 Pro official (Terminal Bench 87.9); SenseNova U1.5 Lite; GLM-5.3 open weights 08-28; Ant Ling-3.0 \u0026amp; ByteDance Seed-OSS-36B open-sourced same day; Xiaohongshu dots3-note preview (MoE 280B/16B active, 512K, Apache-2.0)\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eSecurity\u003c/strong\u003e: OpenAI admits underestimating model offensive capability (HF incident, chained zero-days + leaked credentials), pausing large-scale training for two weeks; Anthropic archives frontier model \u0026ldquo;Model 2\u0026rdquo; over alignment risk; ChainDrop npm worm pollutes 444 packages; OpenAI reverses to lobby for SB53 in California (training-time monitoring + full-cycle cybersecurity); China\u0026rsquo;s mandatory \u0026ldquo;Agent Application Security Basic Requirements\u0026rdquo; national standard project was initiated\u003c/li\u003e\n\u003c/ul\u003e\n",
  "summary": "Daily Research Brief 2026-08-23 📊 Token usage: estimated from retrieval and writing scale.\nCovers the latest AI research, open source and industry moves, updated daily.\nEditor\u0026rsquo;s Note Today\u0026rsquo;s strong signal: \u0026ldquo;the agent race has formally shifted from model worship to systems engineering\u0026rdquo; — papers, open source and industry all point at the runtime layer around the model.\n1. Latest arXiv Papers 1. Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection Abstract: Harness optimization rewrites harness code to improve LLM agents without touching weights — but current methods re-run the full validation set every round even when tasks have lost discriminative power. Task-CoEvolve co-evolves the validation task set with the harness: variance-weighted sampling from history focuses the evaluation budget on the most divergent tasks, with a sampling-aware estimator recovering full-set scores from partial evaluation. Stable gains over fixed-subset baselines on online text classification and Terminal-Bench 2.1, matching full-set search\u0026rsquo;s final performance while cutting evaluation calls by 80% during optimization.\n"
}
