01、文章配图-1
七月二十一号,谷歌憋出的那个大模型终于露脸了。既没开发布会,也没搞直播,官方悄没声息地发了条推,挂了个页面就算完事。感觉是不是有点敷衍?因为这次上线的,压根不是大伙儿盼星星盼月亮等来的 Gemini 3.5 Pro,而是 3 款轻量级模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,还有 Gemini 3.5 Flash Cyber。
不是……明明五月份 I/O 开发者大会上亲口说了六月出旗舰 Pro,现在都七月末了,旗舰连个影子都没有,这算是 AI 时代的新型“大记忆消失术”了!事已至此,那就只能看看这 3 款模型表现到底咋样了。
首先是这次主推的 3.6 Flash,谷歌宣传主打同成本下效果更强。官方给的数据是,3.6 Flash 的输出 Token 消耗比前代降了百分之十八。虽说提升不算特别明显,但这意味着干活比以前顺溜,至少没那么啰嗦,用最快的路径完成任务,省下的就是赚到的。顺带输出单价也降了,从九美元砍到七点五美元/百万 Token,反正怎么省钱怎么来。代码基准测试上,DeepSWE 从三十七点百分之涨到了四十九点百分之,毕竟代码生成的需求是急剧增长的,这方面的能力提升贴近现实生产工程的场景需求,无疑是优化重点。单看纸面数据,像是一次均衡升级,实测情况却不对劲。根据 Artificial Analysis 测试的数据,3.6 Flash 综合智能评分和上代 3.5 Flash 完全持平,本质上只优化了推理链路,模型底层理解能力没提升,虽然完成任务消耗的算力成本更低,但解决复杂问题的上限丝毫没涨。翻译翻译就是,变便宜了,但智力没涨……X 上也有用户实际分享了不同应用场景下 3.6 Flash 的表现,只能说一言难尽了。
说白了,这波 Gemini 升级优化的不是模型智商,是推理效率。它学会了少说废话、少走弯路,完成同样的简单任务,消耗的算力更少、更省钱。但要指望它能搞定更复杂的事,比如长链条代码重构、复杂多模态创作、深度逻辑推演,抱歉,跟以前一样拉胯。可不谈智能的情况下谈省钱,这妥妥的伪命题啊……省 Token 是真省,笨也是真笨。简单批量任务用着划算,一旦涉及复杂逻辑,就得反复提示、多轮修正,看似单次便宜了,总调用成本反而更高,离了大谱!
另一款 3.5 Flash-Lite,定位更极致:便宜,快,吞吐量大。价格不用问,量大管饱,输入零点三美元、输出二点五美元/百万 Token,算是直接干到地板价了。代价也很明显,模型能力大幅裁剪,上下文深度、逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这种流水线粗活。不过,总比 3.1 Flash-Lite 聪明一些。实话说,个人觉得这就是专门给海量标准化任务准备的“算力耗材”,跟智能两个字基本不沾边。至于 3.5 Flash Cyber,这款模型其实和普通用户没啥关系。它专为代码漏洞扫描微调,仅对政府、可信企业内测开放,料想谷歌也是为了 AI 安全防范这套叙事比较严谨,生怕这款模型被用来挖掘攻击漏洞,所以严格锁死准入门槛。看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。至于表现究竟如何?普通用户测不到,在比较知名的 CyberGym 基准上,官方表示 3.5 Flash Cyber 属于具有竞争力的水平,咱就当看个热闹吧。
所以,说了这么多,其实大家最关心的问题是:还能等到 Gemini 3.5 Pro 吗?据彭博社等多家科技媒体的报道,3.5 Pro 缺陷的原因大概率是因为其代码生成与智能体规划能力不达标。在企业付费场景里,代码、自主 Agent 是商业价值颇高的赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。据说,在谷歌多轮内部测试中,3.5 Pro 在代码基准、长程工具调用上始终达不到谷歌内部及格线,即便迭代多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。这么一看,谷歌面临的状况还蛮棘手的,高端客户一直在流失,自家旗舰又迟迟交不出货,除了拿低价 Flash 模型守着中低端盘子,好像也没别的办法。谷歌这边,没准也是因为关注到舆论,大家都在抱怨旗舰跳票,官方工作人员就顺势放了个消息:Gemini 4 已经启动史上最大规模预训练。这……谷歌你这浓眉大眼的,怎么也学会画饼了!当下的产品拿不出手,就用下一代的远期预期安抚资本市场和用户。只能说,这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,而且用多了,只会越来越消耗大家的信任。
按道理说,谷歌做 AI 大模型,不应该拉垮。它是 Transformer 的诞生地,是深度学习时代的王者,DeepMind 做出过 AlphaGo 这种惊艳全世界的成果。没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。此前,网上流传 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成为大家的笑谈。实在不行,不如让 Gemini 直接蒸馏 Kimi K3 吧,这样起码模型表现更好些。毕竟 AI 时代,没有永远的王者,菜就是原罪。
深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!






