我承认,去年的 Gemini 很强,但到了现在,它的风评已经变成了北美大豆包。


和它聊数学问题,结果一转头就出现了大便。


让它画张海滩的照片,结果人直接给用户当成了恋童癖。


因为这些抽象发言,Gemini 在互联网上直接被人扣上了北美大豆包的帽子。


而除了模型本身风平急转直下之外,谷歌最近在科研人员上的变动也是堪称频繁。

两年前,花了 27 亿美元才挖回来的 Transformer 作者(之一),如今也是转身离场,投入了 OpenAI 的怀抱。


甚至就连在 Alpha Fold 里勤勤恳恳干了 9 年的诺贝尔奖得主,也是和 Anthropic 暗送起了秋波。


本来大家盼星星盼月亮的等着 Gemini 3.5 Pro 发布来个一血前耻,结果从五月等到七月还一直没发布。

前几天好不容易有动静了,结果端上来的也不是旗舰的 Pro 模型,而是一个主打“实惠”的 Flash 模型。


那么这个模型的能力是个什么水准呢?

这么说吧,在别家模型都在和 Fable,GPT-5.6 Sol 对标的时候,Gemini 3.5 Flash 挑的对比对象是 GPT-5.6 Luna 和 Claude Sonnet 5。


光是从这个对比上,咱们就能看出谷歌对这个新模型的预期了。。。

在现在大家最重视的 AI 编程和智能体这块,Gemini 更是一泻千里。

在各大排行榜的第一页,你可能甚至都翻不到它的名字。



在生活中,应该也不会真的有人拿 Gemini 来写代码吧?我之前让它来做了个项目迁移的活,结果发现它光顾给人提供情绪价值了,好话说了一大堆,活是一点没干完。


就连谷歌最引以为傲的世界知识能力,也在夯和拉之间疯狂横跳。

夯体现在它的广度上,之前 DeepSeek 就在论文里干脆利落的承认了,说自己在知识的广度上不如 Gemini。

DeepSeek-V4-Pro-Max 在 SimpleQA-Verified 上显著领先所有开源模型,但目前仍落后于领先的闭源模型 Gemini-3.1-Pro。


平时你问它一些冷门的老知识,可能也只有 Gemini 想的起来。

但是,一旦你和它聊的东西是这两年新出来的玩意,Gemini 的反应就会变的十分之诡异。

就比如咱们写这篇稿子的时候,就让 Gemini 帮忙一起梳理了一下大纲。

结果就发现了,在上下文没有任何关联性的前提下,Gemini 突然给我蹦出来了一个 Claude 3.5。


是的,在 Gemini 默认的脑子里,它对 Claude 的认识只到 3.5。

这是因为现在的 Gemini 模型里,不管是今年 5 月发布的 3.5 Flash,还是去年 6 月发布的 Gemini 2.5 Pro。

这些模型的内置的知识库,都只记下了 25 年 1 月份之前的知识。


所以 25 年 2 月发布的 Claude 3.7 它才根本不认识,只认识 24 年发布的 3.5,于是直接开始自信说胡话了。


这就导致你平时和 Gemini 聊天的时候,万一聊到了这一年半里发生的事情,那 Gemini 就会开始抓瞎抽风。

如果你想让它了解一些最新的知识,那就必须开联网搜索才行,但是很多时候,开了联网搜索后,模型又会因为吃进去了太多资料而能力下降,一根筋直接变成了两头堵。


而同样御三家的 GPT 和 Claude,老早就把知识库给更新到去年年底了,只有谷歌还抱着这个老知识库一直不放,直到前两天发布的 Gemini 3.6 Flash,才把自家的知识库给更新到了 26 年 3 月。


你很难想象,靠搜索起步的谷歌,在自己最擅长的信息这块被人给拷打了。

所以,Gemini 身上到底发生了什么?

再翻遍了各种权威媒体的爆料之后,我们会发现太阳底下没有新鲜事,Gemini 最近的表现不如预期,其实是背后的谷歌,整个 AI 组织架构混乱的一种体现。

和 OpenAI,Anthropic 这些纯粹的大模型公司不一样,对谷歌来说,Gemini 从来不是一个聊天机器人这么简单。

它既是 DeepMind 手里的前沿模型,也是 Google Search 守住搜索入口的武器,还是 Google Cloud 卖给企业客户的 API,又要进 Android、Chrome、Workspace、Pixel、Google Home。。。


每条业务线都想把 AI 变成自己的下一代入口,每条业务线都觉得自己手里的场景最重要。

那么谁才是最重要的那个大哥?

The Information 之前就报道过,谷歌 AI Labs 的同事曾经做过一个叫 NotebookLM 的 AI 笔记应用,结果这东西一出来,就惹得内部做 Gmail 和 Google 文档的同事不乐意了。

谁让你这么干了,懂不懂点职场规矩?这不是抢自己活吗?

甚至还有小道消息说, Workspace 的员工还准备过要关停 NotebookLM


除此之外,Google Cloud 团队和 Deepmind 团队也干过一场。


Pixel 的手机团队想给 Pixel 手机做一些 AI 功能,还会被内部要求不能和 Gemini 助手形成竞争。


这是公司太大以后,每个山头都在保护自己的入口,每个团队都在担心别人的产品抢了自己的位置。

AI 还没开始真正改变世界,谷歌内部已经先开始抢起了方向盘。

英国哲学家霍布斯在《利维坦》里描绘过一种:所有人对所有人的战争的状态。


简单来说就是:啥都想要,但蛋糕不够分,所以只能无休止地互掐。

现在的谷歌就如此,部门和部门之间的边界就成了楚河汉界,所有人都紧紧捂着自己碗里的那点场景。

这种风气甚至影响到了谷歌内部的算力分配上。

按理说,谷歌最不该缺的就是算力。

它自己有 TPU,有云,有数据中心,还会把 TPU 卖给 Anthropic、Meta Midjourney 这样的外部公司。。。

但商业和科研如何平衡,成了谷歌内部的一个大问题。

在谷歌内部,一些 AI 研究员会感觉到,公司其实更喜欢把算力分给付钱了的氪金用户,氪金的才是大爷。


这些内部的弯弯绕绕也造成了一批员工的离职。

甚至很多 AI 研究员发现,与其在谷歌层层申请算力等待审批走流程,不如直接一步到位离职让自己给自己打工。

自己出来创业自己搞算力,反而比在谷歌干等着要来的快的多。


如果说对一般的研究员来说,谷歌的限制是算力,那么对不少大牛研究员来说,或许在金钱方面,谷歌也交不出想要的答卷。

作为一家市值已经突破 4 万亿美元的超级巨头,谷歌能给这些顶级人才的薪酬,除了现金之外,大多是跟公司高度绑定的限制性股票。


这股票能赚钱吗?能赚钱,能赚大钱吗?有点难。

你就算再拼命,谷歌的市值还能在短期内翻几倍?

但对面的 OpenAI 和 Anthropic 就不一样了。

这俩最近可都在偷偷摸摸准备上市,如果你现在过去,就很有可能能分到一些原始股,那等上市结束后就可以直接财富自由超级加倍,这可比打工香多了.


当然,谷歌也不是没有意识到这些问题。

前段时间更是调整了组织架构,在常规的预训练和中训练中间,整了一个“中训练”团队,来专门强化模型的编程能力。


虽然目前大家对 Gemini 3.6 Flash 议论纷纷,但是现在的谷歌,已经自信的表示,他们已经开始了训练 Gemini 4 的准备。


谷歌能否能重铸荣光,或许就看这一波了。

虽然今天聊了不少 Gemini 存在的问题,但是你知道的,我一直是谷歌的粉丝。

去年的 2.5 Pro 我非常喜欢,甚至直到现在,现在我也会觉的 Gemini 写出来的文字会更有活人感。

这份活人感,在这个全民卷 Coding 能力的时代则是变的更加可贵。

撰文:早起

编辑:江江 & 面线

美编:素描

图片、资料来源

https://www.nytimes.com/2022/05/02/technology/google-fires-ai-researchers.html

https://m.economictimes.com/tech/artificial-intelligence/googles-top-ai-executive-seeks-the-profound-over-profits-and-the-prosaic/amp_articleshow/125299628.cms

https://www.ft.com/content/c5d52f72-71ef-40bc-bad3-61afdba8b378?syn-25a6b1a6=1

https://startupfortune.com/midjourneys-tpu-regret-is-a-warning-for-ai-startups/

https://x.com/akshen121/status/2070793817222230262

https://www.ft.com/content/c5d52f72-71ef-40bc-bad3-61afdba8b378?syn-25a6b1a6=1