Gemini 4 Argon 发布:百万输出、API 价格与开放限制

Gemini 4 Argon 长任务软件工程与受控网络安全防御概念插画

Google 于 9 月 30 日发布 Gemini 4 Argon,重点面向长任务软件工程、专业工作和网络安全防御。100 万输出 tokens 是最显眼的规格,但模型目前仍处于有限开放阶段。开发者更需要关注的是:它能否持续完成复杂任务,以及长输出会带来怎样的成本和接入条件。

资料核查:2026 年 10 月 1 日,UTC+8。本文依据官方资料整理,并分析开发者接入时的考虑因素,未进行 Argon 实测。 Google 发布公告

当前开放范围:先面向可信防御团队

Argon 正通过 Fairwind Program 向可信网络安全防御团队逐步开放。Google 表示,后续扩大供应会先覆盖付费 API 客户和 Google AI Ultra 订阅用户,但尚未公布全面开放日期。

现在订阅 Ultra 并不意味着立即获得 Argon。 普通 Gemini 用户也不能据此认定模型已经出现在自己的账号中。Fairwind 有资格审核和访问控制要求,符合条件的机构可以申请。Fairwind 官方说明

截至核查时,Gemini API 模型目录尚未列出 Argon 的公开模型 ID。接入前仍需确认账号资格、地区、输入上限和速率限制,本文不提供无法验证的调用示例。

百万 tokens 是输出上限

Google 将 输出上限从此前的 64K 提升到 1M,为更长的推理和多步骤任务提供空间。这个数值不能直接用作输入上下文窗口规格,也不保证每次都生成百万 tokens 的可见答案。官方规格说明

跨文件修改、持续排错和大型迁移可能受益于更长的生成空间,减少任务中途截断。不过,生成能继续,并不代表代码一定正确。版本管理、自动化测试和人工审核仍然需要跟进。

接入流程可以按可验收的阶段组织:先提交修改计划,再完成一批小改动,最后执行测试并列出遗留问题。应以可以验证的交付结果判断长任务价值,不能把输出长度本身当作质量。

官方评测不能概括为全面领先

以下数据来自 Google 官方模型页面,不是本文实测。并列三个软件工程指标,可以更清楚地看到模型的强项和不足。官方评测表

评测 Gemini 4 Argon GPT-6 Astra Claude Opus 5.5
DeepSWE v1.1 77.9% 74.1% 74.2%
FrontierSWE v2 55.0% 65.5% 62.3%
Terminal-bench 4.0 57.4% 58.2% 66.4%

Argon 的 DeepSWE 分数较高,但在 FrontierSWE 上低于 Astra,在 Terminal-bench 上低于 Opus。各评测的题目、环境和验收标准不同,不能合并成同一个成功率,更不能直接套用到自己的项目。

同一页面还给出 **AutomationBench 51.3%**,用于观察端到端业务任务表现。它有参考价值,但不能当作生产环境可靠性保证。本文未核对完整评测方法文件,因此不推测工具框架、重试次数或推理预算是否一致。

更有用的模型对比,是固定一组真实工作:一个已知缺陷、一项跨模块修改、一份需要核实的文档。记录完成时间、总费用、测试结果和人工返工量,再判断模型是否适合团队。延伸阅读:AI 模型排行榜与评测指标解析。

API 价格要区分首发优惠和常规费率

公告费率以美元/每百万 tokens计价。官方价格及脚注

项目 首发优惠 优惠结束后
输入 US$2 US$4
输出 US$10 US$20

官方还公布**缓存输入优惠 95%**。按优惠期输入费率计算,缓存输入约为 US$0.10/百万 tokens,这是根据折扣推算的结果。公告未明确优惠截止日期,做预算时应同时考虑常规费率。

假设一次任务累计产生 100 万普通输入 tokens 和 10 万计费输出 tokens,纯 token 费用在优惠期约为 US$3,优惠结束后约为 US$6。这只是算术示例,并非实测账单,也不包含工具、存储等额外服务费用。推理 tokens 如何计费,仍需等待正式 API 文档确认。

多轮智能体可能反复传入项目背景和工具结果,应核算整个任务的累计用量。缓存命中率、失败重跑次数和提前停止机制,都会影响最终成本。

接入前可以先做的准备

Argon 值得关注,但正式集成需要公开 API 文档和账号资格作为依据。现在可以先完成三项准备:

  1. 保留任务基线。 用有明确验收标准的缺陷修复、重构和文档任务记录现有模型表现。
  2. 限制长任务投入。 设定费用、耗时和重试上限,避免持续生成却迟迟没有可交付结果。
  3. 明确操作权限。 在隔离环境修改和测试代码,对生产部署、数据删除及外部操作设置明确的审批节点。

更大的输出空间提供了新的可能性,但开放时间、计费细节和实际项目表现仍有待确认。获得访问资格后,先用范围小、有测试保障的任务评估,再决定是否扩大使用。