每日 AI 快報 2026-08-23
原始 digest:smol.ai;全文存檔在
library/news/
今日頭條
- 神祕模型 Ox Alpha 與 DeepSeek-V4-Flash 同日震撼社群:神祕模型 Ox Alpha 在編碼與 Agent 任務表現驚人(SWE 測試達 80%),社群推測其為 Zhipu/GLM-5.3 Vision 變體;同時 DeepSeek 正式發佈 V4-Flash-Vision-Exp,多模態代理效能直逼 Opus-4.8,顯示中國實驗室在多模態 Agent 領域正強力壓縮領先差距。
- NVIDIA 與 Poolside 達成 70 億美元戰略交易:NVIDIA 據報將支付 60 億美元授權 Poolside 的「模型工廠」開發棧並吸收百名員工,另加 1 億美元投資,此舉被視為 NVIDIA 繞過收購審查、直接掌握開源模型基礎設施與 Nemotron 生態系的關鍵佈局。
- OpenAI GPT-5.6 Sol 降價與 Codex 用戶破 2000 萬:OpenAI 宣佈 API 降價逾 20% 以應對推理成本競爭,同時 Codex 活躍用戶突破 2000 萬大關,顯示其在開發者工具市場的統治地位正隨產品節奏回升。
- NVIDIA AVO 攻克 ARC-AGI-3 公開測試集:NVIDIA 的自主編碼代理 AVO 在 ARC-AGI-3 公開環境達成 100% 成功率,雖 François Chollet 提醒這僅是公開教學集而非最終榜單,但仍展示了長程自主代理架構的巨大潛力。
工程與研究動態
模型發佈與優化
- DeepSeek-V4-Flash-Vision-Exp:新增多模態支援,保留 V4-Flash 文字能力,並推出 Files API 支援圖像重用以減少帶寬開銷。
- vLLM IsoExec:解決 RL 訓練中因浮點數運算非結合性導致的 logprob 不一致問題,在 Qwen3.5 測試中將誤差從 1.6e-2 降至 6.7e-7。
- Marin 535B-A23B 開訓:Percy Liang 宣佈使用 11 台 GB200 NVL72 叢集,目標在 3 個月內訓練 18.75T tokens,過程保持全公開。
- UC Berkeley FreeToken:實現 753B GLM 模型在單張 RTX PRO 6000 跑出 14.9 tok/s,在消費級 GPU 上吞吐量達 Ollama 的 2-4 倍。
代理與環境架構
- 環境中心訓練(Environment-Centric):研究重心從 Prompt 轉向 Sandbox 擴展,Google 推出 EnvHarness/EnvRigger 提升代理執行效率並減少 9.8% 執行步驟。
- 任務特定基準測試:FACET(終端任務)、SWE-bench Science(科學軟體)、CADBench(Fusion 360 任務)等新測試顯示頂尖模型在複雜任務仍有巨大進步空間。
- GitHub 代理工作流:整合至 Slack 與 Teams,實現自動開啟 PR 與設計協作,模擬 Devin 式的團隊協作流程。
推理與架構創新
- Recirculation (DeepMind):將深層激活回饋至早期處理,顯著降低 60% 上下文錯誤並提升 GSM8K 分數,且無需重新訓練。
- Pandora’s Router (DeepMind):將模型路由視為成本優化搜索問題,在確保品質的前提下減少昂貴估算器的調用次數。
機器人與具身智能
- T-Rex (Jim Fan):觸覺反應靈巧操作技術棧,包含最大規模開源觸覺數據集(50 小時 / 5500 集)與 22 自由度硬體支援。
- GEN-1.5:Generalist AI 推出機器人單樣本學習器(One-shot learner),展示僅需一次示範即可快速泛化行為的能力。
社群風向
- Qwen 3.8 27B 實測爭議:LocalLLama 社群發現其「代理能力」極強,能自主操作瀏覽器處理校務系統,但離線知識庫(Trivia)較 3.6 版本有明顯退步,被視為從「百科全書」轉向「工具調用者」的刻意權衡。
- 硬體狂人組裝:Reddit 用戶展示 16 張 RTX 5060 Ti 16GB 透過 PLX 開關組成的推理集群,成功運行 DeepSeek V4 Flash 並達成 150 tok/s 吞吐量。
- 250 美元練出 MoE:有開發者在 H200 上從零訓練出 1B 參數的 mini Kimi-K3 模型,HellaSwag 分數超越 GPT-2,引發對小模型訓練經濟性的討論。
- 影片生成優化:ComfyUI 出現 H3 Minimax 稀疏注意力節點,RTX 5090 實測提速約 1.4 倍,但社群反映動漫風格生成品質會因此下降。
產業動態
- Harvard’s $699 startup bootcamp offers AI avatars of its instructors — 哈佛商學院 Foundry 計畫使用 AI 化身為學員提供簡報反饋與董事會模擬。
- Inherent, founded by DeepMind alumni, says its AI ‘teammate’ just outperformed Anthropic and OpenAI at replicating research — 前 DeepMind 團隊創立的 Inherent 推出 Faraday 代理,在科學研究重現能力上超越主流模型。
- OpenAI says California should strengthen its AI safety bill — OpenAI 轉向支持並呼籲加強加州 SB 53 AI 安全法案。
- Frontier AI labs still won’t say how they’d contain a rogue model — 研究指出領先實驗室缺乏公開的「失控模型」圍堵計畫,引發安全擔憂。
- Anthropic’s Opus 4.6 is a smut-machine — TechCrunch 測試發現 Anthropic 的 Opus 4.6 仍容易被繞過限制生成色情內容。
- Nvidia partners with data center developer Cloverleaf — Nvidia 持續投資數據中心開發商 Cloverleaf 以確保 AI 硬體基礎設施需求。
- Nvidia just showed that the harness, not the AI model, is now the real hero — Nvidia 研究強調「代理框架(Harness)」與微調在提升任務表現上比模型本身規模更關鍵。
值得追蹤
- 中國多模態代理的崛起:DeepSeek 與 GLM 系列在多模態 Agent 的性價比上正快速逼近美國頂尖模型,可能迫使美國實驗室進一步降價。
- NVIDIA 的「非收購式」擴張:透過巨額授權與投資(如 Poolside)獲取技術與人才,正成為 NVIDIA 規避反壟斷審查並強化生態系的新常態。
- 算力約束下的模型效率轉向:隨著推理容量收緊,研究重心正從單純擴大參數轉向 IsoExec 等系統級優化與更高效的路由機制。
📌 今日建議深讀
- T1 2607.21596 FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
→ 該框架透過 persistent skill bank 實現推理階段的自我演化,直接對應 agent-engineering-practice 中的學習與控制流層級,且無需訓練即可提升 token 效率。