Reports
Report 2026-08-23 5 sources

每日 AI 快報 2026-08-23

openaideepseeknvidiaanthropicdeepmindgooglegithubreddit gpt-5.6-solcodexkimi-k3ox-alphadeepseek-v4-flash-vision-expnvidia-avoglm-5.3qwen3.8-27b isoexecsparse-attentionshot-planningrecirculationpandora’s-routerchinchilla-scaling-lawsone-shot-learningstartup-bootcamp

每日 AI 快報 2026-08-23

原始 digest:smol.ai;全文存檔在 library/news/

今日頭條

  • 神祕模型 Ox Alpha 與 DeepSeek-V4-Flash 同日震撼社群:神祕模型 Ox Alpha 在編碼與 Agent 任務表現驚人(SWE 測試達 80%),社群推測其為 Zhipu/GLM-5.3 Vision 變體;同時 DeepSeek 正式發佈 V4-Flash-Vision-Exp,多模態代理效能直逼 Opus-4.8,顯示中國實驗室在多模態 Agent 領域正強力壓縮領先差距。
  • NVIDIA 與 Poolside 達成 70 億美元戰略交易:NVIDIA 據報將支付 60 億美元授權 Poolside 的「模型工廠」開發棧並吸收百名員工,另加 1 億美元投資,此舉被視為 NVIDIA 繞過收購審查、直接掌握開源模型基礎設施與 Nemotron 生態系的關鍵佈局。
  • OpenAI GPT-5.6 Sol 降價與 Codex 用戶破 2000 萬:OpenAI 宣佈 API 降價逾 20% 以應對推理成本競爭,同時 Codex 活躍用戶突破 2000 萬大關,顯示其在開發者工具市場的統治地位正隨產品節奏回升。
  • NVIDIA AVO 攻克 ARC-AGI-3 公開測試集:NVIDIA 的自主編碼代理 AVO 在 ARC-AGI-3 公開環境達成 100% 成功率,雖 François Chollet 提醒這僅是公開教學集而非最終榜單,但仍展示了長程自主代理架構的巨大潛力。

工程與研究動態

模型發佈與優化

  • DeepSeek-V4-Flash-Vision-Exp:新增多模態支援,保留 V4-Flash 文字能力,並推出 Files API 支援圖像重用以減少帶寬開銷。
  • vLLM IsoExec:解決 RL 訓練中因浮點數運算非結合性導致的 logprob 不一致問題,在 Qwen3.5 測試中將誤差從 1.6e-2 降至 6.7e-7。
  • Marin 535B-A23B 開訓:Percy Liang 宣佈使用 11 台 GB200 NVL72 叢集,目標在 3 個月內訓練 18.75T tokens,過程保持全公開。
  • UC Berkeley FreeToken:實現 753B GLM 模型在單張 RTX PRO 6000 跑出 14.9 tok/s,在消費級 GPU 上吞吐量達 Ollama 的 2-4 倍。

代理與環境架構

  • 環境中心訓練(Environment-Centric):研究重心從 Prompt 轉向 Sandbox 擴展,Google 推出 EnvHarness/EnvRigger 提升代理執行效率並減少 9.8% 執行步驟。
  • 任務特定基準測試:FACET(終端任務)、SWE-bench Science(科學軟體)、CADBench(Fusion 360 任務)等新測試顯示頂尖模型在複雜任務仍有巨大進步空間。
  • GitHub 代理工作流:整合至 Slack 與 Teams,實現自動開啟 PR 與設計協作,模擬 Devin 式的團隊協作流程。

推理與架構創新

  • Recirculation (DeepMind):將深層激活回饋至早期處理,顯著降低 60% 上下文錯誤並提升 GSM8K 分數,且無需重新訓練。
  • Pandora’s Router (DeepMind):將模型路由視為成本優化搜索問題,在確保品質的前提下減少昂貴估算器的調用次數。

機器人與具身智能

  • T-Rex (Jim Fan):觸覺反應靈巧操作技術棧,包含最大規模開源觸覺數據集(50 小時 / 5500 集)與 22 自由度硬體支援。
  • GEN-1.5:Generalist AI 推出機器人單樣本學習器(One-shot learner),展示僅需一次示範即可快速泛化行為的能力。

社群風向

  • Qwen 3.8 27B 實測爭議:LocalLLama 社群發現其「代理能力」極強,能自主操作瀏覽器處理校務系統,但離線知識庫(Trivia)較 3.6 版本有明顯退步,被視為從「百科全書」轉向「工具調用者」的刻意權衡。
  • 硬體狂人組裝:Reddit 用戶展示 16 張 RTX 5060 Ti 16GB 透過 PLX 開關組成的推理集群,成功運行 DeepSeek V4 Flash 並達成 150 tok/s 吞吐量。
  • 250 美元練出 MoE:有開發者在 H200 上從零訓練出 1B 參數的 mini Kimi-K3 模型,HellaSwag 分數超越 GPT-2,引發對小模型訓練經濟性的討論。
  • 影片生成優化:ComfyUI 出現 H3 Minimax 稀疏注意力節點,RTX 5090 實測提速約 1.4 倍,但社群反映動漫風格生成品質會因此下降。

產業動態

值得追蹤

  • 中國多模態代理的崛起:DeepSeek 與 GLM 系列在多模態 Agent 的性價比上正快速逼近美國頂尖模型,可能迫使美國實驗室進一步降價。
  • NVIDIA 的「非收購式」擴張:透過巨額授權與投資(如 Poolside)獲取技術與人才,正成為 NVIDIA 規避反壟斷審查並強化生態系的新常態。
  • 算力約束下的模型效率轉向:隨著推理容量收緊,研究重心正從單純擴大參數轉向 IsoExec 等系統級優化與更高效的路由機制。

📌 今日建議深讀

  • T1 2607.21596 FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
    → 該框架透過 persistent skill bank 實現推理階段的自我演化,直接對應 agent-engineering-practice 中的學習與控制流層級,且無需訓練即可提升 token 效率。
Sources 5 items