在昨晚的发布会上,谷歌意外推出了新的旗舰人工智能模型Gemini 4 Argon,超出众多人的预期。该模型在多项基准测试中表现出色,不仅超过了GPT 6 Astra和Claude Opus 5.5,尤其在DeepSWE v1.1的真实软件工程任务上以77.9%的成绩位居全球最高。同时,在谷歌公布的18项测试中,Argon独占12项第一,并与其他模型并列1项成绩。
作为Google DeepMind在过去七个多月中的首款高级自主研发模型,Gemini 4 Argon在推理能力方面达到了新高度,智能分析指数(AII)得分为53,与GPT-6 Astra持平,超过GPT-6.1 Sol。其幻觉率仅为15%,在所有得分超过45的模型中最低。Argon的大规模输出能力达到100万token,支持多种输入格式,其中API价格目前享有大幅折扣。
虽然以往Gemini模型在智能体性能方面有所不足,但Argon在各类评估中表现明显改进,尤其在AutomationBench-AA测试中以77.5%的成绩领先。谷歌表示,Argon特别适用于软件工程、金融法律及网络安全等长程复杂任务,并且有助于优化量子计算程序和内存管理。
尽管现在还只能向特定的用户群体开放,通常会期望能够在不久的将来广泛使用。谷歌尽显其技术优势,虽然跑分表现良好,但实际使用感受仍需通过真实项目进行验证。随之而来的竞争将使模型用户享受到更好的体验。对于Gemini 4 Argon是否能超越Opus 5.5,期待大家在评论区讨论。希望大家在国庆假期过得愉快!
发表评论