
SpaceXAI's New "Killer App": Grok 4.6 Agent Outperforms GPT-5.6 and Fable 5 in Tests, Priced at Half That of Competitors
Grok 4.6 的 API 起售價為 2 美元/百萬輸入 Token、6 美元/百萬輸出 Token。該模型強化長程執行能力,可自主測試並持續修正,在多項智能體和知識工作測試中進入前沿模型第一梯隊,GDPVal-AA v2 測試中取得評分 1753 Elo,高於 GPT-5.6 Sol Max 和 Claude Fable 5 Max,遠超上一代 Grok 4.5 High。SpaceXAI 稱,新模型上線首周在 Cursor 和 Grok Build 中還提供 2 倍包含用量。
美東時間 8 月 12 日週三,馬斯克旗下 SpaceXAI 正式發佈新一代大模型 Grok 4.6。SpaceXAI 稱,新模型相比 Grok 4.5 實現顯著提升,重點強化長時間運行的智能體(Agent)、複雜編程、知識工作以及交互式和視覺任務能力。
此次發佈最受關注的並非單純的模型迭代,而是Grok 4.6 在 SpaceXAI 公佈的多項前沿模型測試中已經躋身第一梯隊,同時 API 起售價僅為 2 美元/百萬輸入 Token、6 美元/百萬輸出 Token。SpaceXAI 稱,其定價約為其他前沿模型的一半;該模型上線首周在 Cursor 和 Grok Build 中還提供 2 倍包含用量。
SpaceXAI 公佈的測試數據顯示,Grok 4.6 在 Artificial Analysis Intelligence Index 中取得 61 分,與 OpenAI 前沿模型 GPT-5.6 Sol Max 持平;在 GDPVal-AA v2 中則取得 1753 Elo,超過 GPT-5.6 Sol Max 的 1728 分和 Anthropic 前沿模型 Claude Fable 5 的 1741 分。

馬斯克隨後在社交媒體轉發有關 Grok 4.6 是巨大升級、在所有基準測試中得分均超過 Grok 4.5 High 的帖子,強調 Grok 4.6 評分達到 1753 Elo,並自誇新模型太牛了。

從知識工作到編程,Grok 4.6 全面強化複雜任務能力
Grok 4.6 此次升級的核心,不再只是回答問題,而是讓模型能夠持續完成需要多步驟執行的複雜任務。
SpaceXAI 表示,Grok 4.6 重點針對長時間運行的智能體進行訓練,可以連續完成研究主題、分析信息、處理代碼庫,以及把一個模糊的產品想法轉化為可運行的應用或工作成果。公司還稱,新模型在更長的任務軌跡中開始表現出更多自主測試和驗證能力,會在繼續執行之前檢查此前的工作。
在訓練方面,Grok 4.6 經歷了比 Grok 4.5 更長的補充訓練,加入經過篩選的模型生成推理數據、高質量工程數據,並改進優化器和訓練方案。隨後,SpaceXAI 利用 Grok 4.5 生成覆蓋不同推理強度、智能體框架以及 STEM、軟件工程和知識工作的 SFT 軌跡,並進一步通過強化學習訓練模型完成通用編程、知識工作、內核優化、網頁開發和計算機輔助設計等任務。
SpaceXAI 特別強調,Grok 4.6 在把 “想法” 變成 “產品” 方面有所提升。對於一個具體的產品構想,模型可以先研究陌生領域、設計應用結構、實現核心交互,再根據反饋進行多輪迭代;在視覺和交互式項目中,新模型也能夠更快形成較為完整的第一版成果。
低價策略直指開發者市場,首周 Cursor 等產品加倍放量
相比模型能力本身,Grok 4.6 的定價策略可能更加值得 AI 產業鏈關注。
SpaceXAI 公佈的 API 價格從每百萬輸入 Token 2 美元、每百萬輸出 Token 6 美元起,另有速度更快、價格翻倍的版本。公司同時宣佈,Grok 4.6 已經接入 Cursor、Grok Build,並通過 OpenRouter、Vercel 和 Cloudflare 等合作伙伴提供。
作為對比,SpaceXAI 在公告中將 Grok 4.6 定位為 “其他前沿模型的一半價格”。而投資機構 Atreides Management 首席投資官 Gavin Baker 的評價更為激進:他認為,Grok 4.6 的性能大致相當於 Fable 5 Max,但輸入 Token 價格低 80%、輸出 Token 價格低 88%,因此在性能與成本的組合上具有明顯優勢。
科技業分析師、Superintelligence Newsletter 主編 Kim Monnis 也指出,Grok 4.6 不僅比 Opus 5 和 GPT-5.6 Sol 便宜,甚至低於 Sonnet 5,同時性能至少處於頂級模型水平。在他看來,這種 “前沿性能 + 低成本” 的組合才是 Grok 真正的護城河。
需要指出的是,API 單價並不能完全等同於實際使用成本。不同模型的 Token 消耗、推理強度和任務完成路徑存在差異,因此 “便宜一半” 主要是對公佈 API 價格的比較,而不是意味着所有具體任務的最終成本都恰好低 50%。
首周促銷也進一步強化了這一低價策略:SpaceXAI 表示,Cursor 和 Grok Build 用户在首周可以獲得 2 倍包含用量,讓開發者可以低成本試用 Grok 4.6。
強化長程執行能力,模型可自主測試並持續修正
從測試結果看,Grok 4.6 的提升尤其集中在智能體執行真實工作這一正在成為 AI 模型競爭核心的領域。
SpaceXAI 重點展示了 Artificial Analysis 推出的 GDPVal-AA v2。該測試基於 OpenAI 的 GDPval 數據集,考察模型在真實世界、具有經濟價值的專業任務中的表現,覆蓋 44 個職業和 9 個主要行業;模型需要在智能體環境中使用 Shell 和網頁瀏覽等工具完成任務,並通過盲測兩兩比較最終產出的文件,由此形成 Elo 評分。
在 SpaceXAI 此次公佈的對比數據中,Grok 4.6 在 GDPVal-AA v2 取得 1753 Elo,排名高於 GPT-5.6 Sol Max 的 1728 分和 Claude Fable 5 Max 的 1741 分,較上一代 Grok 4.5 High 的 1526 分大幅提高。
與此同時,Grok 4.6 在 Artificial Analysis Intelligence Index 中獲得 61 分,與 GPT-5.6 Sol Max 持平;該指數是由 9 項測試綜合而成,用於衡量模型在數學、科學、編程和推理等多個維度的綜合能力。
在 SpaceXAI 公佈的其他測試中,Grok 4.6 同樣較上一代有明顯進步:
- CursorBench v3.2:69.9%,Grok 4.5 High 為 66.7%;
- FrontierCode v1.1:61.3%,Grok 4.5 High 為 56.6%;
- APEX-Agents:57.5%,Grok 4.5 High 為 47.1%;
- APEX-SWE:56.4%,Grok 4.5 High 為 53.6%;
- AA-Briefcase:1577 分,Grok 4.5 High 為 1313 分;
- Harvey LAB:15.8%,Grok 4.5 High 為 12.9%。
但 Grok 4.6 並非在所有測試中都佔據第一。例如在 DeepSWE 1.1 和 Terminal-Bench v3.0 中,SpaceXAI 公佈的 GPT-5.6 Sol Max 成績仍高於 Grok 4.6。因此,更準確的説法是,Grok 4.6 已經在多項智能體和知識工作測試中進入前沿模型第一梯隊,而不是全面擊敗所有競爭對手。
值得注意的是,Artificial Analysis 的 GDPVal-AA v2 排行榜本身會隨着模型新增和評測更新而變化,因此本文標題所稱的 “力壓” 特指 SpaceXAI 此次發佈時公佈的橫向測試結果,而非宣稱 Grok 4.6 在所有時間、所有評測體系中均排名第一。
從模型到生態,SpaceXAI 加速搶佔 AI 開發入口
Grok 4.6 的發佈還顯示,SpaceXAI 正在把競爭從單純的模型性能比拼,進一步延伸到開發者入口和應用生態。
目前 Grok 4.6 已經同時進入 Cursor、Grok Build 和 API,並接入 OpenRouter、Vercel、Cloudflare 等渠道。SpaceXAI 希望藉助這些平台,讓開發者可以直接把 Grok 4.6 嵌入編程、網頁開發和智能體工作流,而不只是通過 Grok 聊天產品使用模型。
馬斯克本人也在 X 上密集為新模型站台。他先是宣佈 “Grok 4.6 is now out”,隨後轉發有關 1753 Elo 排名的報道,並強調 Grok 4.6 在 GDPVal-AA v2 中取得第一;在另一條轉發中,他列出了 Grok 4.6 在 AA-Briefcase、Harvey LAB、CursorBench、FrontierCode、APEX-Agents 和 APEX-SWE 等測試中的排名,最後評價稱:“Grok 4.6 is a banger”。
而 Atreides Management 的 Gavin Baker 則進一步把市場注意力引向下一代產品。他預計,Grok 4.7 將是規模明顯更大的模型,並可能將 Cursor 和 SpaceX 數據納入預訓練。這一説法目前屬於投資人士的判斷,並非 SpaceXAI 此次發佈公告確認的產品路線。
如果 Grok 4.6 能夠在保持前沿模型級別能力的同時持續維持較低的 Token 價格,那麼其意義可能不僅是一代模型的性能升級,更可能成為AI 大模型價格戰向智能體時代延伸的一個新信號:當不同廠商的模型能力差距逐漸縮小時,性能與推理成本之間的平衡,可能越來越成為開發者和企業選擇模型的關鍵。
