让正文阅读与延伸浏览形成一条连续的信息链路
内容页聚焦阅读稳定性、元信息清晰度与下一步跳转意愿, 通过更集中化的文章主区域、可快速识别的内容辅助模块与轻量分享动作, 让阅读完成后的后续浏览更加自然。
内容页聚焦阅读稳定性、元信息清晰度与下一步跳转意愿, 通过更集中化的文章主区域、可快速识别的内容辅助模块与轻量分享动作, 让阅读完成后的后续浏览更加自然。
在阅读场景中减少视觉干扰,同时保留必要的跳转与推荐能力。
谷歌在近7个月的沉寂之后,终于带来了重磅消息。北京时间10月1日凌晨,Google DeepMind推出了全新的Gemini 4 Argon,这是该公司7个月以来推出的首款高于Flash级别的闭源模型。根据Artificial Analysis的智能指数评测,Argon获得了53分,这一成绩追平了GPT-6 Astra和Fable 5.1,并比GPT-6.1 Sol高出1分,同时其幻觉率降至15%。在AutomationBench-AA和Terminal Bench的评测中,Argon展现出显著的Agent能力提升,并在CWE-bench网络安全基准测试中并列第一,能够自主发现、验证漏洞并生成PoC。目前,Argon已经在特定用户中开始推广,支持1万个上下文和多模态输入,在前沿模型市场中掀起了一场价格风暴。值得注意的是,在首发促销期内,Argon每完成一个任务的平均成本为1.99美元,约为GPT-6 Astra的60%。这样既有竞争力的定价,确实让人不得不重新审视任务选择的方向。
然而,深入分析分数、价格和使用量后,一些有趣的趋势开始显现。尽管Argon在售价上极具优势,但其实际使用成本却相对较高。打折结束后,完成类似任务的费用甚至可能超过Astra。过去的七个月里,Argon作为谷歌首款高于Flash级别的非公开模型,依然显示出了强大的竞争力。其53分相比于前一款非Flash模型Gemini 3.1 Pro Preview提升了23分,与Gemini 3.8 Flash相比也高出了12分。因此,智能指数的评测清楚表明,谷歌重返了全球最顶尖实验室之列。
为了长期吸引用户,谷歌在报价上也颇具诚意。Token大致可以视为模型处理文本时的计算单位,目前Argon在输入方面每百万Token收费2美元,输出收费10美元,这一价格仅为Opus 5.5的一半,更是Astra的1/5。更令人惊喜的是,符合条件的输入可以享受95%的扣减,这一优惠比Gemini 3.8 Flash的90%更加优越,首发期间每百万个缓存输入Token只有0.10美元,这笔账看似相当划算。但对于使用者来说,最终付出的账单还需考虑多个因素。Argon在处理一项任务时平均输出6.2万Token,而Astra仅需2.7万Token,虽然单价较低,但写得更多却让总体成本增加。 金年会
在任务成本计算中,Argon的1.99美元虽然低于Astra的3.26美元、Opus 5.5的5.98美元与Fable 5.1的7.63美元,但与Sol的0.72美元相比,Argon的成本高出许多。需要注意的是,当前的2美元和10美元费用是首发期间的5折优惠,谷歌尚未透露促销结束的具体时间,届时标准价格恢复后,单任务的成本将变为3.98美元,接近于Astra的1.2倍。因此,这些数字的计算也与具体的使用情况密不可分,诸如代码修改、资料查询等任务均会影响最终账单。
更为复杂的是,Argon虽然在单价上以1/5的成本竞争,但在实际任务账单上却需支付近六成的费用;而促销结束后,可能反超对手。长期考虑接入的用户,需要依据自身任务进行详尽的拆算,以确保选择最佳方案。如何在价格和质量之间找到平衡,是用户不得不面对的挑战。
那么,Argon究竟在何处展现出其独特之处呢?在我看来,最为显著的便是它对“未知”的处理。在AA-Omniscience测试中,Argon的幻觉率为15%,在智能指数45分以上的模型中名列最低,Astra则为51%,Sol更高达54%。这表明Argon更倾向于承认自身的局限性,从而减少在不确定情况下给出错误答案的风险。这一特性极具吸引力,尤其是在面对陌生问题时,变得更加亲切和可信。模型如果愿意停下脚步承认自身的不足,至少能够指引用户继续探索需要查证的信息。 金年会
然而,减少错误并不等同于正确答案的数量。Argon在这一测试中的答题准确率为50%,低于Astra的63%,甚至还比Gemini 3.1 Pro Preview低5个百分点,综合评分为42,接近于Astra的43,且与Sol持平。因此,在享受Argon能做到的克制时,用户也需接受它答对问题的频率远远不及Astra。需留意的是,15%的幻觉率仅适用于特定测试,不能简单延伸到所有的日常回答。
在具体应用上,Argon的Agent能力体现出的多样性和差异化也令人关注。虽然在AutomationBench-AA测试中,它以77.5%的成绩获得了第一名,但在Terminal Bench 4中,Argon的得分为57%。尽管这一成绩较Gemini 3.1 Pro Preview提升了53个百分点,依然不及其他竞争对手。这一系列表现使得Argon的未来充满了期待和未知。