Expandus
返回 Futurism
Grok

Grok 4:人類嘅最後考驗?AI 係咪真係準備好超越我哋

Grok 4 喺人類級考試(HLE)取得 44.4% 歷史新高,推理同工具整合能力領先業界。但黑盒問題、速度同透明度仍係隱憂。一文睇清 Grok 4 嘅真實水平。

Exp
作者 ExpJul 23, 2025
分享文章

重點摘要

  • Grok 4 喺人類級考試(HLE)取得 44.4% 歷史新高,推理同工具整合能力領先業界。但黑盒問題、速度同透明度仍係隱憂。一文睇清 Grok 4 嘅真實水平。

Grok 4 最近喺人類級考試(HLE)中取得高達 44.4% 嘅成績,超越其他所有 AI 模型。佢喺 GPQA 科學測試同 AIME 數學測試中同樣表現出色,展現自然語言理解同推理能力嘅重大突破。不過專家指出,佢仍未完全超越人類——複雜推理同創造力依然係差距所在。

Grok AI 係乜嘢?

Grok AI 係由 xAI 開發嘅聊天機械人,xAI 係 Elon Musk 旗下 X 平台(前稱 Twitter)嘅 AI 公司。「Grok」一詞源自科幻小說術語,意思係「深度理解」。

Grok AI 發展時間線

1. 起源——xAI 成立(2023 年)

  • Elon Musk 喺 2023 年 7 月創立 xAI,使命係打造「追求真相」嘅 AI
  • 有別於 OpenAI 同 Anthropic,xAI 側重開放式知識探索,而非嚴格嘅安全框架

2. Grok 正式推出(2023 年 11 月)

  • Grok 喺 2023 年 11 月面世,整合入 X 平台
  • 標誌性風格:幽默、大膽,能夠感知 X(Twitter)嘅即時內容
  • 以「比 ChatGPT 更直接、更少審查」作為賣點推廣

3. 與 X 平台整合

  • Grok 直接從 X 抽取數據,針對熱門新聞同社交話題提供具脈絡感嘅回應

4. 模型升級

  • 建立於 xAI 自家大型語言模型(LLM),由「Grok 1」起步
  • Grok 1.5(2024 年初)效能大幅提升,邏輯同編程能力媲美 GPT-4
  • Musk 宣布分階段開源 Grok

5. Grok 2.0(2024 年中)

  • 支援更長文本處理、更佳程式碼生成,以及基本圖像理解
  • 開始向多模態能力邁進,加入圖像輸入支援

Grok 4 表現亮點

HLE 考試成績

喺人類級考試(HLE)中,Grok 4 取得 24% 嘅創紀錄成績。HLE 聚焦於專家級問題,強調深度推理同數學能力。約 10% 嘅 HLE 題目涉及多模態輸入,包括圖像理解,將模型推向前所未有嘅複雜程度。

Grok 4 喺 GPQA 基準測試中同樣取得 95.4%,展現跨領域理解同專家級任務嘅卓越表現。

與其他模型比較

測試

Grok 4(無工具)

Grok 4 Heavy(有工具)

Gemini 2.5 Pro

OpenAI o3

Claude Opus 4

人類級考試(HLE)

25.4%

44.4%

21.6%

21%

N/A

ARC-AGI-2 視覺推理

16.2%

N/A

26.9%(有工具)

N/A

~8.1%

  • Grok 4 喺 HLE 超越 Gemini 同 OpenAI(25.4% vs 21.6% 同 21%)
  • Grok 4 Heavy 配備工具後達到 44.4%,遠超 Gemini 2.5 的 26.9%
  • 視覺推理方面,Grok 4(16.2%)係 Claude Opus 4 的兩倍
  • Grok 4 Heavy 的多代理支援大幅提升問題解決能力

技術創新

工具整合

Grok 4 的主要技術突破包括:

  1. 獎勵系統偏向可驗證答案,促進第一性原理思考
  2. 使用超過上代模型 100 倍 嘅運算資源
  3. 訓練過程中原生整合工具使用——模型學會使用計算器或知識庫等工具
  4. 演示中 Grok 4 處理咗由數學、概率到模擬黑洞碰撞等各類任務

Grok 4 Heavy 支援最多 256,000 tokens(上下文長度),同時運行四個子代理進行多工處理。配備工具後 44.4% 嘅 HLE 成績超越 Google 頂級模型,將邏輯同理解能力推向精英層次。

多代理協作

透過代理使用系統,Grok 4 將複雜任務分配給不同代理處理——例如用一組 AI 醫生回答健康問題,或用 AI 律師處理法律諮詢。

強化學習同大量運算投入驅動 Grok 嘅推理能力。Grok 4 Heavy 比較多個代理嘅輸出以選出最佳答案,喺各學科達到博士級別嘅表現。

局限同門檻

尚未達到人類水平

儘管取得突破,Grok 4 未能完全超越人類智能,原因包括:

  1. 缺乏透明度 —— 模型細節未有公開
  2. 生成速度較慢 —— 75 tokens/秒,遠低於 Gemini Flash 嘅 353 tokens/秒
  3. 上下文長度限制 —— 256K tokens,遠低於 GPT-4.1 或 Gemini Pro 嘅 100 萬
  4. 倫理問題 —— 過去出現未過濾內容問題,監督機制不清晰
  5. 現實整合尚未完善 —— 與 Tesla 整合同人形機械人計劃仍處於早期階段

專家將 Grok 4 稱為「黑盒」系統。缺乏模型卡同審計工具,引發對信任同安全性嘅質疑。

風險同爭議

  • 內容安全問題: Grok 曾生成仇恨言論同冒犯性內容
  • 安全風險: 美國政府使用場景中出現未授權數據存取事件
  • 敏感資訊洩漏同數據處理透明度不足,增加使用風險
  • 部分機構以合規為由,已禁止使用 Grok 等商業 AI 工具

挑戰在於:如何在創新同透明度、道德之間取得平衡。Grok 必須在發展同時建立安全保障,以建立長期信任。

總結

Grok 4 喺多項基準測試中領先,但仍未完全超越人類。

  • Musk 表示 Grok 4 或許可以喺技術任務上超越博士水平,但仍缺乏常識同原創性
  • 專家呼籲加強 AI 治理同全球合作

跨行業協作係引導 AI 發展、造福全人類嘅關鍵所在。

常見問題

Has Grok 4 Surpassed ChatGPT?
Grok 4 scored 25.4% on the Human-Level Exam (HLE) without tool assistance, outperforming OpenAI o3’s 21%.
Where can Grok 4 be used?
It’s ideal for scientific research, law, medicine, software development, and education—helping boost productivity across fields.