把Gemini“刻”进硅片:谷歌Frozen v2芯片能否改写AI算力游戏规则?

把Gemini“刻”进硅片:谷歌Frozen v2芯片能否改写AI算力游戏规则?

  • 2026-07-21
  •  97

关键词: 谷歌Frozen v2 AI专用芯片 Gemini大模型 TPU 算力能效

7月21日消息,据The Information援引两名知情人士报道,谷歌正在研发一款内部代号为“Frozen v2”的全新服务器芯片,计划将Gemini大模型的底层运算架构直接固化进硬件层面。参与项目的工程师测算,该芯片落地后,按单位功耗可处理的词元(Token)数量计算,能效将达到谷歌现有最新一代自研AI芯片的6至10倍,最早于2028年部署。

“冻结”的设计哲学

“Frozen”(冻结)这一代号精准概括了其设计思路:将大模型的部分运算逻辑永久蚀刻在硅片硬件中。

当前应用最广泛的AI芯片——英伟达GPU和谷歌TPU——均为通用型芯片,可适配多种大模型,但运行任何模型时都需要实时执行大量耗时的逻辑判断。Frozen v2则专为Gemini系列模型量身打造,通过内置Gemini的底层运算逻辑,大幅减少运算步骤和数据搬运量,从而缩短AI问答的响应时延,并有望支撑谷歌落地一批全新的AI应用场景。

驱动这一项目的现实压力,是谷歌严峻的AI算力短缺。知情人士称,算力缺口已加剧谷歌内部资源分配矛盾,甚至导致谷歌云不得不回绝部分外部客户的合作订单。

初代教训:从“固化权重”到“固化架构”

Frozen v2并非谷歌首次尝试把AI模型“写入”硬件。初代方案由谷歌DeepMind首席科学家杰夫·迪恩(Jeff Dean)牵头,计划将完整的模型权重直接蚀刻进芯片。但该方案存在致命缺陷:芯片只能适配单一版本的Gemini模型,硬件生命周期极短,项目因此被搁置多年。

Frozen v2在初代基础上做了关键调整:不再固化完整模型权重,而是仅将底层架构逻辑固化进芯片,同时保留通过更新内置模型权重(决定模型回答质量的核心参数)进行迭代的能力。

不过,这也意味着一场押注:只有后续迭代的Gemini模型沿用与芯片设计时一致的基础架构,才能在该芯片上正常运行。一旦谷歌未来转向全新模型架构,这批专用芯片的价值将大打折扣。目前工程师团队仍在敲定核心功能模块及各组件的协同方案,并权衡固化模型信息的深度,以求在硬件灵活性与运行能效之间取得最佳平衡。

不取代TPU,而是开辟第二条芯片产品线

在谷歌的芯片版图中,Frozen v2将与现有TPU形成互补关系,而非取而代之。谷歌今年已推出第八代TPU,并直接面向云客户销售,正面挑战英伟达在AI芯片市场的垄断地位;谷歌已与Meta签署数十亿美元大单,向其出租TPU算力,同时积极向英伟达的核心云厂商客户推销TPU产品。

事实上,谷歌的自研芯片战略已初见成效——通过在设计TPU时围绕Gemini进行适配,其运行自家大模型的硬件成本已经下降,只是TPU内置的模型信息远少于Frozen系列芯片。

值得注意的是,谷歌目前并无大规模量产Frozen v2的计划,其产能规模将远低于TPU。有限的量产规模意味着谷歌可以延后引入外部设计和代工合作伙伴;更重要的是,谷歌将这一代产品视为技术试验平台,待大模型底层架构趋于稳定后,为研发更高专用化芯片积累工程经验。

推理芯片赛道日益拥挤

Frozen v2折射出一个更大的行业趋势,那就是AI推理芯片正成为巨头和初创公司共同竞逐的热点。

从SambaNova、d-Matrix等初创企业,到OpenAI、微软等科技巨头,各方都在试图打造比英伟达GPU能效更高的推理芯片,以缓解全球算力紧缺和成本高企的痛点;英伟达自身也在去年12月斥资200亿美元获得推理芯片初创企业Groq的技术授权。

各家技术路线与谷歌的Frozen方案不尽相同,但与加拿大芯片初创公司Taalas的思路相近——二者均将特定AI模型的运算逻辑硬编码至芯片硬件。Taalas已完成超2亿美元融资,投资方包括Quiet Capital和富达投资。

对于上述报道,谷歌官方发言人回应称,公司各团队“持续研发、测试各类创新技术,力求为用户与企业客户实现极致性能与能效”,并强调“并非所有研发项目都会落地量产,但这种全方位技术探索,是我们全栈自研技术路线的核心一环”。

结语

如果通用GPU时代的关键词是“灵活”,那么Frozen v2代表的方向则是“极致专用”——用硬件的确定性换取能效的飞跃。6至10倍的能效提升若能兑现,对深受算力成本之困的AI行业而言意义重大。但这一路线的前提是模型架构的长期稳定,在Transformer架构仍在快速演进的当下,谷歌的这场押注能否成功,2028年才能见分晓。

受上述消息提振,谷歌股价周一盘中一度上涨3.7%,最终收涨1.52%。


来源:电子工程专辑