{
  "title": "Daily Research Brief 2026-07-20",
  "url": "/en/posts/research-brief-2026-07-20/",
  "permalink": "https://hackcv.com/en/posts/research-brief-2026-07-20/",
  "date": "2026-07-20",
  "lastmod": "2026-07-20",
  "author": "",
  "description": "Daily research brief — AI / LLM / Agent / Computer Vision / Audio-Video / Engineering",
  "categories": ["Research Brief"],
  "tags": ["AI","LLM","Agent","Computer Vision","Audio-Video","Engineering","Daily Brief"],
  "cover": "https://picsum.photos/seed/daily-research-brief-2026-07-20/1200/675",
  "readingTime": 1,
  "wordCount": 212,
  "content": "\u003ch1 id=\"daily-research-brief-2026-07-20\"\u003eDaily Research Brief 2026-07-20\u003c/h1\u003e\n\u003cp\u003e📊 Token usage: estimated from retrieval and writing scale.\u003c/p\u003e\n\u003cp\u003eCovers the latest AI research, open source and industry moves, updated daily.\u003c/p\u003e\n\u003chr\u003e\n\u003ch2 id=\"editors-note\"\u003eEditor\u0026rsquo;s Note\u003c/h2\u003e\n\u003cp\u003eTwo main threads today. First, \u0026lsquo;open-weight models reach the substantive stage of matching closed source\u0026rsquo; — Thinking Machines\u0026rsquo; Inkling (975B), PrismML squeezing 27B into an iPhone, DeepSeek V4 set for 7/24, plus the FLI safety index finding \u0026lsquo;open vs closed gap narrowed to 4-7 months\u0026rsquo; — open source is no longer a cheap alternative but a capability competitor, and enterprise model selection must include open weights as a default candidate. Second, \u0026lsquo;agents descend from the chat box into infrastructure primitives\u0026rsquo;.\u003c/p\u003e\n\u003ch2 id=\"1-latest-arxiv-papers\"\u003e1. Latest arXiv Papers\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eRxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.14187\"\u003ehttps://arxiv.org/abs/2607.14187\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eThink at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.15621\"\u003ehttps://arxiv.org/abs/2607.15621\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eS-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.13926\"\u003ehttps://arxiv.org/abs/2607.13926\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eScaling Behavior Foundation Model for Humanoid Robots\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.15163\"\u003ehttps://arxiv.org/abs/2607.15163\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eFVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.16190\"\u003ehttps://arxiv.org/abs/2607.16190\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eMotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.16192\"\u003ehttps://arxiv.org/abs/2607.16192\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.14681\"\u003ehttps://arxiv.org/abs/2607.14681\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003cli\u003e\n\u003cp\u003e\u003cstrong\u003eStructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure\u003c/strong\u003e — \u003ca href=\"https://arxiv.org/abs/2607.11388\"\u003ehttps://arxiv.org/abs/2607.11388\u003c/a\u003e\u003c/p\u003e\n\u003c/li\u003e\n\u003c/ol\u003e\n",
  "summary": "Daily Research Brief 2026-07-20 📊 Token usage: estimated from retrieval and writing scale.\nCovers the latest AI research, open source and industry moves, updated daily.\nEditor\u0026rsquo;s Note Two main threads today. First, \u0026lsquo;open-weight models reach the substantive stage of matching closed source\u0026rsquo; — Thinking Machines\u0026rsquo; Inkling (975B), PrismML squeezing 27B into an iPhone, DeepSeek V4 set for 7/24, plus the FLI safety index finding \u0026lsquo;open vs closed gap narrowed to 4-7 months\u0026rsquo; — open source is no longer a cheap alternative but a capability competitor, and enterprise model selection must include open weights as a default candidate. Second, \u0026lsquo;agents descend from the chat box into infrastructure primitives\u0026rsquo;.\n"
}
