7 月 21 日,谷歌新的大模型终于出炉了。既没搞发布会,也没开直播,官方只是默默发了条推文,上了个页面就完事了。感觉是不是挺敷衍?毕竟大家翘首以盼的旗舰机型 Gemini 3.5 Pro 没影,取而代之的是 3 款轻量级模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber。
说好的 5 月 I/O 开发者大会上亲口承诺 6 月就上旗舰 Pro 模型呢?眼瞅着都 7 月末了,这旗舰连个影儿都没见着,这要是换个新词儿,大概就是 AI 纪元的新型“大记忆消失术”了!既然事已至此,那就只能看看这 3 款模型表现到底咋样了。
首先是这次主推的 3.6 Flash,谷歌宣传主打“同成本下效果更强”。官方给出的数据显示,3.6 Flash 的输出 Token 消耗比前代降低了 18%。虽说提升不算特别大,但这意味着干活效率变高了,至少不会像以前那么啰嗦,能用最快路径搞定交代的任务,省下来的不就是赚到的吗?顺带输出单价也降了,从 9 美元直接砍到了 7.5 美元/百万 Token,反正怎么省钱怎么来。
代码基准测试上,DeepSWE 分数从 37% 涨到了 49%。毕竟代码生成的需求是急剧增长的,这方面的能力提升贴近现实生产工程场景,自然成了优化重点。单看纸面数据,似乎是一次均衡升级,可实测后情况不对劲了。根据 Artificial Analysis 的测试数据,3.6 Flash 的综合智能评分和上一代 3.5 Flash 完全持平。本质上它只优化了推理链路,模型底层的理解能力并没有提升。虽说完成任务消耗的算力成本更低,但解决复杂问题的上限丝毫没涨。
翻译翻译就是,变便宜了,但智力没涨……X 平台上也有用户实际分享了不同应用场景下 3.6 Flash 的表现,只能说一言难尽了……
说白了,这波 Gemini 升级优化的不是模型智商,是推理效率。它学会了少说废话、少走弯路,完成同样的简单任务,消耗的算力更少、更省钱。但要是指望它能搞定更复杂的事,比如长链条代码重构、复杂多模态创作、深度逻辑推演,抱歉,跟以前一样拉胯。
可不谈智能的情况下谈省钱,这妥妥的伪命题啊……省 Token 是真省,笨也是真笨。简单批量任务用着划算,一旦涉及复杂逻辑,就得反复提示、多轮修正,看似单次便宜了,总调用成本反而更高,离了大谱!
另一款 3.5 Flash-Lite,定位更极致:便宜,快,吞吐量大。价格不用问,量大管饱,输入 0.3 美元、输出 2.5 美元/百万 Token,算是直接干到地板价了。代价也很明显,模型能力被大幅裁剪,上下文深度、逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这种流水线粗活。不过,总比 3.1 Flash-Lite 聪明一些。实话说,个人觉得这就是专门给海量标准化任务准备的“算力耗材”,跟智能两个字基本不沾边。
至于 3.5 Flash Cyber,这款模型其实跟普通用户没啥关系。它专为代码漏洞扫描微调,仅对政府、可信企业内测开放,料想谷歌也是在 AI 安全防范这套叙事里比较严谨,生怕这款模型被用来挖掘攻击漏洞,所以严格锁死准入门槛。看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。至于表现究竟如何?普通用户测不到,在比较知名的 CyberGym 基准上,官方表示 3.5 Flash Cyber 属于具有竞争力的水平,咱就当看个热闹吧。
所以,说了这么多,其实大家最关心的问题是:还能等到 Gemini 3.5 Pro 吗?据彭博社等多家科技媒体报道,3.5 Pro 缺陷的原因大概率是因为其代码生成与智能体规划能力不达标。在企业付费场景里,代码、自主 Agent 是商业价值颇高的赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。据说,在谷歌多轮内部测试中,3.5 Pro 在代码基准、长程工具调用上始终达不到谷歌内部及格线,即便迭代多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。
这么一看,谷歌面临的状况还蛮棘手的,高端客户一直在流失,自家旗舰又迟迟交不出货,除了拿低价 Flash 模型守着中低端盘子,好像也没别的办法。谷歌这边,没准也是因为关注到舆论,大家都在抱怨旗舰跳票,官方工作人员就顺势放了个消息:Gemini 4 已经启动了史上最大规模的预训练。
这……谷歌你这浓眉大眼的,怎么也学会画饼了!当下的产品拿不出手,就用下一代的远期预期安抚资本市场和用户。只能说,这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,而且用多了,只会越来越消耗大家的信任。
按道理说,谷歌做 AI 大模型,不应该拉垮。它是 Transformer 的诞生地,是深度学习时代的王者,DeepMind 做出过 AlphaGo 这种惊艳全世界的成果。没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。
此前,网上流传 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成为大家的笑谈。实在不行,不如让 Gemini 直接蒸馏 Kimi K3 吧,这样起码模型表现更好些。毕竟 AI 时代,没有永远的王者,菜就是原罪。
深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!









