Reports
Report 2026-08-24 4 sources

每日 AI 快報 2026-08-24

linkdazeflock-safety ox-alpha stealth-modelsurveillance-technologycopyrighted-books

每日 AI 快報 2026-08-24

原始 digest:smol.ai;全文存檔在 library/news/

今日頭條

  • 神秘模型 Ox Alpha 與 DeepSeek 多模態發布:神秘模型 Ox Alpha 在 Coding 與 Agent 任務展現極強性能,引發社群熱議其可能為 Zhipu/GLM 系列模型;同時 DeepSeek 正式發布 DeepSeek-V4-Flash-Vision-Exp,在多模態 Agent 表現上直追 Opus-4.8,顯示中國實驗室在性價比與多模態領域正強力施壓。
  • OpenAI 降價應戰與 Codex 用戶激增:OpenAI 將 GPT-5.6 Sol 的 API 價格調降逾 20% 以應對競爭,並透露 Codex 活躍用戶已達 2,000 萬;這反映出 Agent 工作流正從實驗階段轉向大規模產品化,且市場競爭焦點已轉向推理成本與效率。
  • NVIDIA 巨額授權 Poolside 技術:NVIDIA 傳出將支付 60 億美元授權 Poolside 的模型開發堆疊「Model Factory」,並投資 10 億美元且延攬其百餘名員工;此舉顯示 NVIDIA 正透過非典型收購手段,強化其在開源模型 Nemotron 生態系與基礎設施的掌控力。
  • NVIDIA AVO 攻克 ARC-AGI 公開測試:NVIDIA AVO 在 ARC-AGI-3 公開測試環境達成 100% 成功率,宣稱具備長程自主 Agent 能力;然而 François Chollet 提醒這僅限於公開教學集而非完整基準測試,引發社群對 Agent 泛化能力的持續辯論。

工程與研究動態

Agent 框架與環境模擬

  • [TLDR] Google 推出 EnvHarness 與 EnvRigger,透過插件層與策略診斷改善靜態環境,能以減少 9.8% 的執行步驟提升 9% 的任務表現。
  • [SMOL-TWITTER] GitHub 將協作 Agent 工作流導入 Slack 與 Teams,支援類似 Devin 的自動化 PR 與設計循環。
  • [SMOL-TWITTER] Agent 運行環境 nac v0.1.3 新增沙盒 git 工作區與視覺感知圖像讀取;OpenHands 則將其免費預設模型切換為 Kimi K3。

模型架構與推理優化

  • [SMOL-TWITTER] DeepMind 發表 Recirculation 研究,透過將深層激活回饋至早期處理,在不重新訓練下減少 60% 上下文錯誤並提升 GSM8K 分數。
  • [SMOL-TWITTER] DeepMind 推出 Pandora’s Router,將模型路由視為最佳搜索問題,能以較低成本匹配詳盡估算的路由品質。
  • [SMOL-TWITTER] vLLM 推出 IsoExec,解決強化學習(RL)訓練中浮點運算非結合性導致的 logprob 不匹配問題,確保位元級的一致性。
  • [SMOL-TWITTER] UC Berkeley 的 FreeToken 技術讓 753B 的 GLM-5.2 在單張 RTX PRO 6000 上達到 14.9 tok/s。

機器人與具身智能

  • [SMOL-TWITTER] Jim Fan 推出 T-Rex 觸覺反應靈巧操作堆疊,並釋出包含 50 小時數據、5,500 個情節的大型開源觸覺數據集。
  • [SMOL-REDDIT] Generalist AI 發表 GEN-1.5,具備具身智能的 One-shot 學習能力,宣稱機器人觀察一次示範即可泛化行為。

基準測試 (Benchmarks)

  • [SMOL-TWITTER] SWE-bench Science 推出 119 項科學軟體任務,目前最強的 Claude Code + Opus-5 通過率仍低於 50%。
  • [SMOL-TWITTER] CADBench 顯示頂尖模型在 Fusion 360 任務的通過率僅 24.6%;AI4AI-Bench 測試遞歸自我改進能力,平均得分僅 0.288。

社群風向

  • Qwen 3.8 實測爭議:[SMOL-REDDIT] 用戶實測 Qwen3.8-27B 在單張 RTX 3090 上展現極高自主性,能操作瀏覽器處理大學課程表。但社群發現其知識儲存(Factual Recall)較 3.6 版本退化,推測是為了強化工具調用與 Agent 能力所做的權衡。
  • Ox Alpha 政治審查疑慮:[SMOL-REDDIT] 使用者發現 Ox Alpha 拒絕回答台灣主權問題,引發對其政治安全性與中國背景的疑慮,儘管其 Coding 性能被評為超越 Fable。
  • 影片生成優化與缺陷:[SMOL-REDDIT] ComfyUI 的 H3 Minimax 稀疏注意力節點宣稱 2.5x 加速,但實測僅約 1.4x,且在動漫風格生成上會出現嚴重的形變(Morphing)問題。
  • WRC'26 機器人觀察:[SMOL-REDDIT] 社群對 WRC'26 展出的「機器手臂包裝重定向」速度表示懷疑,認為未經訓練的人類仍快 2 倍,且 360 度掃描器可能是比機械翻轉更優的工程解法。

產業動態

值得追蹤

  • 從 Prompt 轉向 Environment:研究重心正從提示詞工程轉向可執行的沙盒環境(Sandbox Scaling),這可能是提升長程任務能力的關鍵。
  • 算力瓶頸持續:多位業者指出推理算力依然吃緊,模型效率、調度技術與低延遲推理將成為後續競爭的核心。
  • 開源訓練透明化:Percy Liang 宣布 535B 的 Marin 模型開始訓練,將在 11 台 GB200 上處理 18.75T tokens,全程保持公開。
Sources 4 items