Gemini 4 Argon 發布:百萬輸出、API 價格與開放限制

Gemini 4 Argon 長任務軟體工程與受控資安防禦概念插圖

Google 在 9 月 30 日發表 Gemini 4 Argon,把重點放在長任務軟體工程、專業工作與資安防禦。最醒目的規格是 100 萬 output tokens,但目前仍是有限開放。對開發者而言,這次值得看的是模型能否持續處理複雜工作,以及長輸出背後的成本與使用條件。

資料查核:2026 年 10 月 1 日,台灣時間。本文為官方資訊整理與開發者導入分析,沒有進行 Argon 實測。 Google 發布公告

現在誰能用?先看有限開放

Argon 正透過 Fairwind Program 向受信任的資安防禦者逐步開放。Google 表示後續擴大供應時,會先從付費 API 客戶與 Google AI Ultra 訂閱者開始,但沒有在公告中給出全面公開日期。

因此,目前買 Ultra 不等於立即取得 Argon,也不能把這次發表理解成一般 Gemini 使用者都已能切換。Fairwind 本身有資格審核與受控存取規範,適合符合條件的組織申請。Fairwind 官方說明

截至本文查核時,Gemini API 模型目錄尚未列出 Argon 的公開模型 ID。正式整合前,還需要確認帳戶資格、地區、輸入上限與速率限制;這裡先不提供無法驗證的 API 呼叫範例。

百萬 tokens 指輸出,不能當成輸入規格

Google 將 output token limit 從先前的 64K 提高到 1M,用來支撐更長的推理與多步驟工作。這項數字描述的是輸出上限,不能直接當成輸入 context window;也不能保證每次都會得到百萬 tokens 的可見答案。規格原文

如果工作需要跨檔案修改、反覆查錯或大型遷移,更長的生成空間可能減少中途被截斷的情況。不過,模型能持續生成,不代表修改一定正確;版本控制、測試與審查仍要跟上。

導入時可以把任務拆成可檢查的階段:先產出修改計畫,再提交一批小改動,最後跑測試並整理尚未解決的問題。長任務的價值應以可驗證的成果衡量,輸出越長本身不構成優勢。

官方評測有亮點,也有落後項目

下面是 Google 官方模型頁公布的分數,沒有在本文重跑。選取三個軟體工程項目並列,可以看出「在一項領先」與「各種開發任務都較強」之間的差距。官方評測表

評測 Gemini 4 Argon GPT-6 Astra Claude Opus 5.5
DeepSWE v1.1 77.9% 74.1% 74.2%
FrontierSWE v2 55.0% 65.5% 62.3%
Terminal-bench 4.0 57.4% 58.2% 66.4%

Argon 在這張表的 DeepSWE 項目較高,但 FrontierSWE 低於 Astra,Terminal-bench 低於 Opus。 不同評測有各自的題目、工作環境與完成標準,不能混成同一個成功率,也不能據此推定你的專案會得到相同比例。

同一頁另列 **AutomationBench 51.3%**,反映端到端商務工作的測試結果。它有助於觀察模型在程式開發以外的工作能力,但不是生產環境可靠度保證。本文未核對評測方法文件的完整內容,因此不推測工具框架、重試次數或推理預算是否相同。

對自己的 repo,較實用的比較是固定一組真實任務:一個已知 bug、一項跨模組修改、一份需要查證的文件。記錄完成時間、總費用、測試結果和人工修正量,才知道哪個模型適合自己的流程。也可參考本站的 AI 模型排行榜與評測指標解析。

API 價格:上市優惠與優惠後要分開算

公告價格如下,單位為美元/每百萬 tokens。官方價格與註腳

項目 上市優惠 優惠結束後
輸入 US$2 US$4
輸出 US$10 US$20

Google 同時公布快取輸入享 95% 折扣。按優惠期輸入價計算,快取輸入約為 US$0.10/百萬 tokens;這是依折扣做的算術推導。公告未明列優惠截止日,正式預算應同時保留優惠後的情境。

舉個純 token 費用試算:若一次工作累計 100 萬一般輸入 tokens、10 萬計費輸出 tokens,優惠期約 US$3,優惠後約 US$6。計算方式是輸入費加上輸出量乘單價,並非實測帳單;不含工具、儲存等額外服務。推理 tokens 的實際計費分類,仍待正式 API 文件確認。

多輪代理常會重複傳入專案背景與工具結果,預算要看整段工作的累計用量。快取能否命中、失敗後重跑幾次,以及能否提早停止,都會影響最後帳單。

開發者現在可以先準備什麼?

Argon 已經值得追蹤,正式接入則要等可核對的 API 文件與帳戶資格。現在可以先準備三件事:

  1. 建立任務基準。 挑出有明確驗收標準的 bug 修復、重構與文件工作,保存現有模型的結果。
  2. 設定長任務上限。 先定義費用、時間與重試預算,避免一次工作持續生成卻沒有交付。
  3. 保留操作邊界。 在隔離環境跑修改與測試;涉及正式部署、資料刪除與對外操作時,讓流程有清楚的核准點。

這次發布提供了更長的工作空間與值得比較的能力,但開放時程、計費細節與實際專案表現仍需逐一確認。等取得存取資格後,先用小範圍、有測試的工作評估,再決定是否擴大導入。