算力瓶颈下的新尝试
过去一年多,生成式AI的爆发式增长让各大科技公司都面临一个共同难题——算力供不应求。谷歌内部同样如此,据报道,算力短缺不仅导致了不同团队之间对资源的激烈竞争,甚至还迫使谷歌云拒绝过部分外部客户的业务请求。
为了缓解这一压力,谷歌此前已采取多种应对措施。就在上个月,有消息称谷歌同意每月向SpaceX支付近10亿美元,以借助其星链等相关基础设施来弥补算力缺口,从而兑现对企业客户的算力承诺。
这种外部合作虽能解一时之急,但长期来看,自研更高效的芯片无疑是更具根本性的解决方案。
“Frozen v2”是什么
据最新报道,谷歌正在研发一款内部代号为“Frozen v2”的新型服务器芯片。这款芯片的特殊之处在于,它并非像TPU那样的通用型AI加速器,而是专门为运行Gemini模型设计的专用芯片。
其核心思路是:将Gemini模型的部分架构直接永久性地嵌入芯片硬件中。这样一来,当模型处理用户查询时,芯片可以在硬件层面直接完成部分计算步骤,从而显著减少数据在处理器和内存之间传输的次数,以及整体的计算量。
谷歌工程师预计,与公司当前最新一代TPU相比,Frozen芯片在单位功耗下能够提供6到10倍的Token处理能力。这一提升如果实现,意味着用更少的电力和硬件成本,就能支撑同样规模的推理请求。

定位、时间线与局限性
根据报道,谷歌计划在2028年部署Frozen芯片。但它并不会取代现有的通用型TPU产品线,而是作为谷歌定制芯片家族中一个更具针对性的专用分支存在。
谷歌在回应相关问询时表示,公司团队“持续研究并试验各类创新技术,旨在为用户和客户提供最佳性能和最高效率”,并强调“这种严格的探索是我们全栈战略的核心组成部分”。谷歌还补充说,通过从底层协同设计硬件和软件,可以确保整个系统实现深度集成,并针对真实工作负载进行高度优化。
不过,这种“硬件固化模型架构”的做法也存在明显的代价——灵活性大幅降低。报道指出,只有在未来几代Gemini模型继续沿用与当前相同的底层架构时,Frozen芯片才能兼容后续版本。如果模型架构发生重大调整,这块芯片可能就无法有效工作。
也正因如此,谷歌目前将Frozen v2视为一次试验性项目,暂无像TPU那样进行大规模量产的规划。
更紧迫的挑战
虽然Frozen芯片的消息在资本市场上获得了积极回应,但谷歌AI业务眼下还面临着其他更为紧迫的问题。
此前有消息称,下一代Gemini Pro的发布时间已经推迟。与此同时,谷歌还流失了多名资深AI研究人员,他们选择加入了竞争对手的团队。在AI竞赛日益激烈的背景下,人才流失和产品延期对于谷歌来说,可能是比中长期芯片规划更需要优先处理的议题。