AI 戰情報告 (2026-07-04)
昨日 AI 重點新聞
Mistral AI 發表 Leanstral 1.5:引領形式驗證與邏輯推理新高度 ref-16
Mistral AI 推出 Leanstral 1.5,這是一款採用 Apache-2.0 授權的開源模型,擁有 119B 總參數但僅 6B 活躍參數。該模型專門針對 Lean 4 形式驗證優化,在 PutnamBench 數學競賽基準測試中解決了 587/672 個問題,並在代數基準測試 FATE-H 達到 87% 的 SOTA 表現。其具備「代碼代理」環境,能自主編輯檔案並透過編譯器回饋自我修正。
Apple 釋出 Safari MCP 伺服器:賦予 AI 代理瀏覽器原生操控權 ref-4
Apple 的 WebKit 團隊在 Safari Technology Preview 247 中內建了 Model Context Protocol (MCP) 伺服器。這項技術提供 16 種工具,讓相容 MCP 的 AI 代理能直接存取 Safari 分頁、執行 JavaScript、讀取控制台輸出並監測網路請求。這標誌著 Apple 已將 MCP 視為平台級基礎設施,與 Xcode 的 MCP 支援共同構建代理生態。
祖克柏坦承 AI 代理進展緩慢;Meta 積極佈局 Samsung 晶片訂單 ref-308, ref-275, ref-128
Meta 執行長祖克柏指出,AI 代理技術的發展速度低於預期。然而,Meta 並未放慢硬體腳步,據報正與三星洽談一筆價值 65 億美元 的 MTIA 客製化 AI 晶片訂單。此外,Meta 研發中的 Watermelon 模型據稱性能已追平 GPT-5.5,顯示其在算力與模型性能上的追趕野心。
OpenAI 提議政府入股 5% 並推出 Agent RFT 微調平台 ref-132, ref-46
OpenAI 執行長 Sam Altman 提出讓美國政府持有公司 5% 股權,旨在將 OpenAI 的利益與國家安全深度掛鉤以換取政策支持。同時,OpenAI 介紹了 Agent RFT 平台,利用強化學習 (RL) 微調推理模型在即時工具交互中的表現,有效解決了代理在複雜任務中的「信用分配」與路徑優化問題。
主權 AI 熱潮:英國銀行聯手開發模型;印度與日本深化合作 ref-93, ref-255
HSBC、Lloyds 與 NatWest 等英國銀行宣布開發全英首個「主權 AI 模型」以確保金融敏感數據的安全。同時,印度與日本擴大戰略 AI 合作,印度政府亦研擬制定專屬 AI 法律,旨在針對 Deepfake 威脅建立跨國界的技術與法律防禦體系。
代理商務標準化:Google 發表 ARD 規範;Visa 拓展 AI 代理支付 ref-14, ref-102, ref-8
Google 發表 Agentic Resource Discovery (ARD) 開放規範,用於在 Web 上定位與驗證 AI 工具。Visa 則將其支付通行密鑰 (Passkeys) 擴展至代理商務領域,允許 AI 代理在獲得授權後,於旅遊(如 eDreams ODIGEO)等場景自主執行安全支付。
Anthropic 傳與三星洽談自研晶片;Mythos 遺漏關鍵核心漏洞 ref-4, ref-67
Anthropic 正與三星商討生產其首款客製化 AI 晶片。然而,其最強模型 Mythos 在安全領域的表現引發爭議:Mythos 雖然發現了部分 Linux 核心 bug,卻也遺漏了同樣位置的 Bad Epoll 嚴重漏洞,顯示 AI 在「全自動資安審計」上仍有侷限。
EquiLibre 完成 A 輪融資:前 DeepMind 團隊以撲克 AI 技術轉攻金融 ref-13
總部位於布拉格的 EquiLibre 以 5 億美元 估值完成 A 輪融資。該公司由三位前 Google DeepMind 研究員創立,將曾擊敗人類的撲克 AI 邏輯轉移至量化避險基金領域,展現了強推理模型在高度不確定性市場中的決策價值。
geoSurge 融資 1,000 萬歐元:推動「語料工程」優化品牌 AI 能見度 ref-2
geoSurge 獲得 1,000 萬歐元 種子輪融資,提出 Corpus Engineering (語料工程) 概念。該技術不專注於搜尋引擎的 SEO,而是研究模型如何學習與表徵品牌,確保企業在 ChatGPT、Gemini 與 Claude 的生成輸出中獲得正確且優質的呈現。
中國 AI 代理動態:阿里 ElementsClaw 發現超導體;智譜 GLM 5.2 競爭力強 ref-88, ref-97
阿里巴巴 達摩院的 ElementsClaw AI 代理僅耗時 28 GPU 小時便發現 4 種新超導材料。同時,智譜 AI 的 GLM-5.2 模型在多項基準測試中展現出足以匹敵 Anthropic 旗艦模型的競爭力,顯示中資模型在特定領域的領先。
市場洞察
1. 代理生態的「協定化」與平台主權競爭
延續前日對 A2UI 標準的討論,今日 Apple Safari MCP 伺服器 (ref-194) 的發布與 Google ARD 規範 (ref-331) 的推出,顯示 AI 代理的入口正從「單一對話視窗」轉向「作業系統與瀏覽器原生的協議層」。當 Apple 與 Google 同時推動 MCP 與 ARD 時,這代表未來 AI 助理的操作能力將由平台商定義標準。這種「協定主權」的競爭將決定哪些第三方 AI 能無縫進入用戶的數位生活。
2. 「形式驗證」成為高階邏輯代理的核心指標
Mistral Leanstral 1.5 (ref-5) 與 EquiLibre (ref-6) 的動態顯示,AI 的發展正從「文本生成」轉向「嚴謹邏輯驗證」。尤其是在金融與形式數學領域,單純的機率產出已不足夠,具備自我檢查、透過編譯器回饋修正的代理架構正成為主流。這與昨日報告中提到「循環工程 (Loop Engineering)」的趨勢高度吻合:未來的競爭力在於代理能否「證明」其產出的正確性。
3. 「語料工程 (Corpus Engineering)」取代傳統 SEO
geoSurge 的融資 (ref-103) 標誌著行銷典範的轉移。隨著用戶愈來愈多地向 AI 詢問建議而非點擊網頁連結,品牌商的戰場將從「獲取流量」轉向「優化模型內部的品牌表徵」。這種深層的數據治理(確保模型的訓練語料包含正確且正面的品牌資訊)將成為未來企業數位資產管理的核心,也對 ADNEX 這類行銷中台提出了新的技術要求。