Grok 4 最近喺人類級考試(HLE)中取得高達 44.4% 嘅成績,超越其他所有 AI 模型。佢喺 GPQA 科學測試同 AIME 數學測試中同樣表現出色,展現自然語言理解同推理能力嘅重大突破。不過專家指出,佢仍未完全超越人類——複雜推理同創造力依然係差距所在。
Grok AI 係乜嘢?
Grok AI 係由 xAI 開發嘅聊天機械人,xAI 係 Elon Musk 旗下 X 平台(前稱 Twitter)嘅 AI 公司。「Grok」一詞源自科幻小說術語,意思係「深度理解」。
Grok AI 發展時間線
1. 起源——xAI 成立(2023 年)
- Elon Musk 喺 2023 年 7 月創立 xAI,使命係打造「追求真相」嘅 AI
- 有別於 OpenAI 同 Anthropic,xAI 側重開放式知識探索,而非嚴格嘅安全框架
2. Grok 正式推出(2023 年 11 月)
- Grok 喺 2023 年 11 月面世,整合入 X 平台
- 標誌性風格:幽默、大膽,能夠感知 X(Twitter)嘅即時內容
- 以「比 ChatGPT 更直接、更少審查」作為賣點推廣
3. 與 X 平台整合
- Grok 直接從 X 抽取數據,針對熱門新聞同社交話題提供具脈絡感嘅回應
4. 模型升級
- 建立於 xAI 自家大型語言模型(LLM),由「Grok 1」起步
- Grok 1.5(2024 年初)效能大幅提升,邏輯同編程能力媲美 GPT-4
- Musk 宣布分階段開源 Grok
5. Grok 2.0(2024 年中)
- 支援更長文本處理、更佳程式碼生成,以及基本圖像理解
- 開始向多模態能力邁進,加入圖像輸入支援
Grok 4 表現亮點
HLE 考試成績
喺人類級考試(HLE)中,Grok 4 取得 24% 嘅創紀錄成績。HLE 聚焦於專家級問題,強調深度推理同數學能力。約 10% 嘅 HLE 題目涉及多模態輸入,包括圖像理解,將模型推向前所未有嘅複雜程度。
Grok 4 喺 GPQA 基準測試中同樣取得 95.4%,展現跨領域理解同專家級任務嘅卓越表現。
與其他模型比較
測試
Grok 4(無工具)
Grok 4 Heavy(有工具)
Gemini 2.5 Pro
OpenAI o3
Claude Opus 4
人類級考試(HLE)
25.4%
44.4%
21.6%
21%
N/A
ARC-AGI-2 視覺推理
16.2%
N/A
26.9%(有工具)
N/A
~8.1%
- Grok 4 喺 HLE 超越 Gemini 同 OpenAI(25.4% vs 21.6% 同 21%)
- Grok 4 Heavy 配備工具後達到 44.4%,遠超 Gemini 2.5 的 26.9%
- 視覺推理方面,Grok 4(16.2%)係 Claude Opus 4 的兩倍
- Grok 4 Heavy 的多代理支援大幅提升問題解決能力
技術創新
工具整合
Grok 4 的主要技術突破包括:
- 獎勵系統偏向可驗證答案,促進第一性原理思考
- 使用超過上代模型 100 倍 嘅運算資源
- 訓練過程中原生整合工具使用——模型學會使用計算器或知識庫等工具
- 演示中 Grok 4 處理咗由數學、概率到模擬黑洞碰撞等各類任務
Grok 4 Heavy 支援最多 256,000 tokens(上下文長度),同時運行四個子代理進行多工處理。配備工具後 44.4% 嘅 HLE 成績超越 Google 頂級模型,將邏輯同理解能力推向精英層次。
多代理協作
透過代理使用系統,Grok 4 將複雜任務分配給不同代理處理——例如用一組 AI 醫生回答健康問題,或用 AI 律師處理法律諮詢。
強化學習同大量運算投入驅動 Grok 嘅推理能力。Grok 4 Heavy 比較多個代理嘅輸出以選出最佳答案,喺各學科達到博士級別嘅表現。
局限同門檻
尚未達到人類水平
儘管取得突破,Grok 4 未能完全超越人類智能,原因包括:
- 缺乏透明度 —— 模型細節未有公開
- 生成速度較慢 —— 75 tokens/秒,遠低於 Gemini Flash 嘅 353 tokens/秒
- 上下文長度限制 —— 256K tokens,遠低於 GPT-4.1 或 Gemini Pro 嘅 100 萬
- 倫理問題 —— 過去出現未過濾內容問題,監督機制不清晰
- 現實整合尚未完善 —— 與 Tesla 整合同人形機械人計劃仍處於早期階段
專家將 Grok 4 稱為「黑盒」系統。缺乏模型卡同審計工具,引發對信任同安全性嘅質疑。
風險同爭議
- 內容安全問題: Grok 曾生成仇恨言論同冒犯性內容
- 安全風險: 美國政府使用場景中出現未授權數據存取事件
- 敏感資訊洩漏同數據處理透明度不足,增加使用風險
- 部分機構以合規為由,已禁止使用 Grok 等商業 AI 工具
挑戰在於:如何在創新同透明度、道德之間取得平衡。Grok 必須在發展同時建立安全保障,以建立長期信任。
總結
Grok 4 喺多項基準測試中領先,但仍未完全超越人類。
- Musk 表示 Grok 4 或許可以喺技術任務上超越博士水平,但仍缺乏常識同原創性
- 專家呼籲加強 AI 治理同全球合作
跨行業協作係引導 AI 發展、造福全人類嘅關鍵所在。



