Gemini 4 Argon发布:DeepSWE跑分77.9%超越Opus 5.5,但普通用户暂时用不上
当地时间2026年9月30日,Google正式发布Gemini 4系列的首款模型Gemini 4 Argon。这是Google自今年2月Gemini 3 Pro以来发布的首个前沿模型,距上一代已超过七个月。Google DeepMind高级副总裁兼首席AI架构师Koray Kavukcuoglu在官方博客中将其定位为“前沿智能的下一个时代”,主打真实世界软件工程、企业知识工作和网络安全防御。

一、性能表现:DeepSWE刷新纪录,但并非全面领先
Argon在长周期软件工程基准DeepSWE v1.1上取得77.9%的得分,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。作为参照,Gemini 3.6 Flash在同一测试中仅得49%。
但这一成绩需要放在更完整的视角下审视。Google自己计算的Argon得分,竞品数据则来自公开排行榜和公司报告。在18项基准测试中,Argon在12项领先、1项持平、5项落后,落后的领域涉及编程、科学和计算机控制测试。
Argon的输出token上限从Gemini 3代的64,000大幅提升至100万token,Google称这一设计使其能够在单次推演中完成更长周期的自主规划和分析,无需将复杂任务拆分为多个提示词。

二、Google内部的实战应用:代码迁移与内存优化
Google在博客中列举了Argon在公司内部的多个应用案例。
大规模代码迁移。 Argon代理已参与将Google内部C/C++代码库迁移至Rust,规模从re2、libgav1等核心库的数千行,到Fuchsia OS Zircon内核的80多万行。在libgav1项目中,Argon替换了3.2万行SIMD代码,最终Rust版本执行速度比原Rust版本快2.7倍,性能接近高度优化的C++版本。Google强调,大规模代码重写在投入生产前均经过严格的人工和自动审计。
内存优化。 Argon代理分析Google数据中心的全系统性能数据,自主识别并应用内存优化方案,全面部署后释放了超过300 TiB内存,预计整体可节省约500 TiB至1 PiB。
量子计算优化。 在量子算法优化中,Argon仅用几分钟就交出了比现有公开文献好40%的时空资源优化方案。

三、成本悖论:推广期便宜,推广后可能更贵
Argon的定价策略是本次发布中一个需要特别关注的细节。
推广期定价:每百万输入token 2美元、输出10美元,缓存输入价格低95%。这一价格显著低于GPT-6 Astra的标准定价(输入10美元/输出50美元),也低于Claude Opus 5.5的定价。Artificial Analysis数据显示,在推广期价格下,Argon单任务成本为1.99美元,比GPT-6 Astra低约40%。
推广期结束后的定价:将上调至每百万输入token 4美元、输出20美元。这一价格调整的影响被Argon的token使用特征放大了。
Artificial Analysis发现,Argon平均每任务使用约62,000个输出token,远超GPT-6 Astra。在推广期价格下,Argon单任务成本为1.99美元,但若恢复标准定价(4/20美元),Argon单任务成本将升至约3.98美元,比Astra的标准价格更贵。换言之,Argon的“性价比优势”在很大程度上依赖于推广期的折扣。开发者如果将其纳入长期成本规划,需要将推广期结束后的价格变化考虑在内。

四、Fairwind计划:为什么普通用户暂时用不上
Argon目前仅通过Fairwind计划向受信任的网络安全防御合作伙伴开放。Kavukcuoglu在博客中解释,这一分阶段策略的核心逻辑是:这一级别的能力需要被安全地释放。Google表示正在配合美国政府的自愿性预发布模型评估流程,在扩大开放范围前持续收集早期测试者反馈并改进安全防护。
Fairwind计划于9月初启动,已有超过650个合作伙伴,包括政府机构和关键基础设施运营商。Google计划向这些受信任的防御方发布不带网络安全护栏的Argon版本,使其能够像攻击者一样思考,在恶意行为者发现漏洞之前完成修补。
在安全能力方面,Argon在Gray Swan间接提示注入基准测试中得分0.7%(越低越好),优于Claude Opus 5.5和Fable 5.1的1.0%,大幅优于GPT-6 Astra的8.5%。Google表示正在部署监控Argon思维链和行动的机制,必要时会停止执行。

五、内部争议:基准分数与实战体验之间的落差
彭博社在Argon发布后报道称,部分谷歌内部员工对该模型在实际工作中的表现存在疑虑。
几位直接参与项目的知情人士透露,尽管Argon在广泛使用的基准测试中成绩不错,但当谷歌员工将其投入实际工作时,表现“不那么理想”,该模型在处理某些编程任务时会遇到困难。彭博社报道发布后,Alphabet股价在盘后交易中回吐了此前约1.7%的涨幅。
谷歌对此明确否认。公司表示“所谓Gemini 4在代码等领域表现不佳的说法并不准确”,并将问询指向Kavukcuoglu此前的公开表态。Kavukcuoglu上周在The Information的会议上表示:“我对这支团队抱有十足的信心。在我看来,我们必将持续站在技术最前沿。”一名熟悉模型开发的谷歌员工称,公司内部已“形成广泛共识”,认为Gemini 4处于行业前沿水平,并否认其在杂乱、真实的编程任务中表现不佳。
谷歌内部对此也存在不同看法。一部分员工认为Anthropic的Fable和OpenAI的Astra迭代速度已超过Gemini;另一部分则认为新版本已经追上领先的AI实验室。

六、常见问题FAQ
Gemini 4 Argon现在能用吗?
目前仅通过Fairwind计划向受信任的网络安全合作伙伴开放。Google表示将逐步扩大至开发者、企业和消费者,首先面向付费API客户和Google AI Ultra订阅者。
Argon真的比Opus 5.5和GPT-6 Astra强吗?
在DeepSWE v1.1上Argon得分更高,但在18项基准测试中有5项落后。Google计算的自己的分数,竞品数据来自公开来源。整体而言Argon进入了第一梯队,但并非全面碾压。
推广期结束后价格会涨多少?
从每百万输入token 2美元涨至4美元,输出从10美元涨至20美元。由于Argon每任务消耗的token较多,成本涨幅可能被进一步放大。
为什么Argon不直接向公众开放?
Google表示这是分阶段安全释放策略。网络安全模型能力越强,被滥用的风险也越大。Fairwind计划让防御方先测试并反馈,Google据此改进安全防护后再扩大开放。
Fairwind计划是什么?
Google于9月初启动的受控早期访问计划,面向经过审核的网络安全防御组织、政府机构和关键基础设施运营商,目前已有超过650个合作伙伴。
豫公网安备 41040202000300 号
评论