每日 AI 快報 2026-08-24
原始 digest:smol.ai;全文存檔在
library/news/
今日頭條
- 神秘模型 Ox Alpha 與 DeepSeek 多模態發布:神秘模型 Ox Alpha 在 Coding 與 Agent 任務展現極強性能,引發社群熱議其可能為 Zhipu/GLM 系列模型;同時 DeepSeek 正式發布 DeepSeek-V4-Flash-Vision-Exp,在多模態 Agent 表現上直追 Opus-4.8,顯示中國實驗室在性價比與多模態領域正強力施壓。
- OpenAI 降價應戰與 Codex 用戶激增:OpenAI 將 GPT-5.6 Sol 的 API 價格調降逾 20% 以應對競爭,並透露 Codex 活躍用戶已達 2,000 萬;這反映出 Agent 工作流正從實驗階段轉向大規模產品化,且市場競爭焦點已轉向推理成本與效率。
- NVIDIA 巨額授權 Poolside 技術:NVIDIA 傳出將支付 60 億美元授權 Poolside 的模型開發堆疊「Model Factory」,並投資 10 億美元且延攬其百餘名員工;此舉顯示 NVIDIA 正透過非典型收購手段,強化其在開源模型 Nemotron 生態系與基礎設施的掌控力。
- NVIDIA AVO 攻克 ARC-AGI 公開測試:NVIDIA AVO 在 ARC-AGI-3 公開測試環境達成 100% 成功率,宣稱具備長程自主 Agent 能力;然而 François Chollet 提醒這僅限於公開教學集而非完整基準測試,引發社群對 Agent 泛化能力的持續辯論。
工程與研究動態
Agent 框架與環境模擬
- [TLDR] Google 推出 EnvHarness 與 EnvRigger,透過插件層與策略診斷改善靜態環境,能以減少 9.8% 的執行步驟提升 9% 的任務表現。
- [SMOL-TWITTER] GitHub 將協作 Agent 工作流導入 Slack 與 Teams,支援類似 Devin 的自動化 PR 與設計循環。
- [SMOL-TWITTER] Agent 運行環境 nac v0.1.3 新增沙盒 git 工作區與視覺感知圖像讀取;OpenHands 則將其免費預設模型切換為 Kimi K3。
模型架構與推理優化
- [SMOL-TWITTER] DeepMind 發表 Recirculation 研究,透過將深層激活回饋至早期處理,在不重新訓練下減少 60% 上下文錯誤並提升 GSM8K 分數。
- [SMOL-TWITTER] DeepMind 推出 Pandora’s Router,將模型路由視為最佳搜索問題,能以較低成本匹配詳盡估算的路由品質。
- [SMOL-TWITTER] vLLM 推出 IsoExec,解決強化學習(RL)訓練中浮點運算非結合性導致的 logprob 不匹配問題,確保位元級的一致性。
- [SMOL-TWITTER] UC Berkeley 的 FreeToken 技術讓 753B 的 GLM-5.2 在單張 RTX PRO 6000 上達到 14.9 tok/s。
機器人與具身智能
- [SMOL-TWITTER] Jim Fan 推出 T-Rex 觸覺反應靈巧操作堆疊,並釋出包含 50 小時數據、5,500 個情節的大型開源觸覺數據集。
- [SMOL-REDDIT] Generalist AI 發表 GEN-1.5,具備具身智能的 One-shot 學習能力,宣稱機器人觀察一次示範即可泛化行為。
基準測試 (Benchmarks)
- [SMOL-TWITTER] SWE-bench Science 推出 119 項科學軟體任務,目前最強的 Claude Code + Opus-5 通過率仍低於 50%。
- [SMOL-TWITTER] CADBench 顯示頂尖模型在 Fusion 360 任務的通過率僅 24.6%;AI4AI-Bench 測試遞歸自我改進能力,平均得分僅 0.288。
社群風向
- Qwen 3.8 實測爭議:[SMOL-REDDIT] 用戶實測 Qwen3.8-27B 在單張 RTX 3090 上展現極高自主性,能操作瀏覽器處理大學課程表。但社群發現其知識儲存(Factual Recall)較 3.6 版本退化,推測是為了強化工具調用與 Agent 能力所做的權衡。
- Ox Alpha 政治審查疑慮:[SMOL-REDDIT] 使用者發現 Ox Alpha 拒絕回答台灣主權問題,引發對其政治安全性與中國背景的疑慮,儘管其 Coding 性能被評為超越 Fable。
- 影片生成優化與缺陷:[SMOL-REDDIT] ComfyUI 的 H3 Minimax 稀疏注意力節點宣稱 2.5x 加速,但實測僅約 1.4x,且在動漫風格生成上會出現嚴重的形變(Morphing)問題。
- WRC'26 機器人觀察:[SMOL-REDDIT] 社群對 WRC'26 展出的「機器手臂包裝重定向」速度表示懷疑,認為未經訓練的人類仍快 2 倍,且 360 度掃描器可能是比機械翻轉更優的工程解法。
產業動態
- Who’s behind the new ‘stealth model’ Ox Alpha? — 神秘模型 Ox Alpha 引發網路熱議,推測其背後為中國實驗室。
- Linkdaze’s smart calendar is built to run a household — Linkdaze 推出免費智慧日曆,內建 AI 膳食規劃工具。
- Flock CEO calls for ‘compromise’ as surveillance company faces growing backlash — 監控技術公司 Flock 面對隱私濫用疑慮,執行長呼籲尋求折衷方案。
- Is it legal to train AI models on copyrighted books? — 法律專題探討 AI 使用版權書籍訓練的複雜性與對作家的潛在威脅。
- Harvard’s $699 startup bootcamp offers AI avatars — 哈佛創業營提供 AI 導師化身,為學員的簡報提供即時回饋。
- Inherent says its AI ‘teammate’ outperformed Anthropic and OpenAI — DeepMind 校友創立的 Inherent 發表 Faraday Agent,在科學研究複製能力上超越主流模型。
值得追蹤
- 從 Prompt 轉向 Environment:研究重心正從提示詞工程轉向可執行的沙盒環境(Sandbox Scaling),這可能是提升長程任務能力的關鍵。
- 算力瓶頸持續:多位業者指出推理算力依然吃緊,模型效率、調度技術與低延遲推理將成為後續競爭的核心。
- 開源訓練透明化:Percy Liang 宣布 535B 的 Marin 模型開始訓練,將在 11 台 GB200 上處理 18.75T tokens,全程保持公開。