首页 / 科技 / 谷歌研发“Frozen v2”服务器芯片 能将AI推理效率提升6至10倍

谷歌研发“Frozen v2”服务器芯片 能将AI推理效率提升6至10倍

摸鱼不慌
摸鱼不慌

据The Information 7月20日报道,知情人士透露,谷歌正在研发一款代号为“Frozen v2”的全新服务器芯片。该芯片的核心技术路径是将Gemini大模型的底层运算架构直接固化进硬件层面,从而显著降低AI推理过程中的能耗与延迟。

硬件固化大模型架构

这一设计思路与此前谷歌自研AI芯片的通用方案不同。“Frozen v2”采用了一种针对特定模型的硬件加速方式,即把Gemini大模型运行所需的核心数学运算逻辑,直接在芯片的电路层级进行物理实现。

知情人士表示,单位功耗可处理的词元数量预计达到谷歌现有自研AI芯片的6至10倍。

词元处理效率的量化提升

所谓“词元”,是指大模型处理文本时的最小单位,一个词元可以对应一个完整的单词或一个词的一部分。模型完成一次推理,需要处理大量词元。单位功耗词元处理量的提升,意味着在相同电力消耗下,芯片可以完成更多的推理任务。

这种效率提升对于大规模部署AI服务的云数据中心尤为重要。更低的能耗和更高的吞吐能力,将直接转化为运营成本的下降和响应速度的提升。

对现有芯片产品的影响

谷歌现有自研AI芯片主要适用于多种AI模型的通用计算场景,而“Frozen v2”则高度专门化,仅针对Gemini系列模型进行优化。一旦投入实际部署,谷歌可能在面向自身AI服务的算力供应链中,逐步降低对第三方通用AI芯片的依赖。

谷歌研发“Frozen v2”服务器芯片 能将AI推理效率提升6至10倍  第1张谷歌当前正面临严峻的 AI 算力短缺困境。内部资源紧张已导致谷歌云不得不回绝部分外部客户的合作订单。Frozen v2 项目的启动,正是为了从根本上破解这一瓶颈。知情人士表示,该芯片最早计划于 2028 年部署。IT之家注意到,“Frozen”(冻结)这一代号精准概括了其设计哲学:将大模型的部分运算逻辑永久蚀刻在硅片硬件中。与英伟达 GPU 及谷歌 TPU 等通用型芯片不同,Frozen v2 并非通用芯片,而是专为 Gemini 系列模型量身打造的专用芯片。通用芯片在运行任意模型时需实时执行大量逻辑判断,而 Frozen v2 通过内置 Gemini 的底层运算逻辑,可显著减少运算步骤和数据搬运量,实现更快的用户响应速度,并有望支撑谷歌推出全新的 AI 应用场景。Frozen v2 并非谷歌首次尝试将 AI 模型“写入”硬件。其初代方案由谷歌 DeepMind 首席科学家杰夫 · 迪恩(Jeff Dean)牵头,计划将完整的模型权重直接蚀刻进芯片。但该方案存在一个致命缺陷:芯片只能适配单一版本的 Gemini 模型,硬件生命周期极短,因此项目被搁置多年。Frozen v2 在初代基础上进行了关键调整,不再固化完整模型权重,而是仅将底层架构逻辑固化进芯片,同时保留通过更新内置模型权重(决定模型回答质量的核心参数)进行迭代的能力。不过,这也意味着谷歌押注自身会持续沿用当前 Gemini 大模型的底层架构,只有后续迭代的 Gemini 模型沿用与芯片设计时一致的基础架构,才能在该芯片上正常运行。目前,工程师团队仍在敲定核心功能模块及各组件的协同方案,同时在权衡固化模型信息的深度,以在硬件灵活性与运行能效之间取得最佳平衡。Frozen v2 将开辟一条全新的自研芯片产品线,与谷歌现有的张量处理器(TPU)形成互补关系,而非取而代之。谷歌今年已推出第八代 TPU,并直接面向云客户推广,正面挑战英伟达在 AI 芯片市场的垄断地位。谷歌已与 Meta 签署数十亿美元大单,向其出租 TPU 算力,同时积极将 TPU 推向英伟达的核心云厂商客户。值得注意的是,谷歌自研 AI 芯片的战略已初见成效。通过在设计 TPU 时围绕 Gemini 进行适配,谷歌已有效降低了 Gemini 模型的运行成本,只是 TPU 内置的模型信息远少于 Frozen 系列芯片。尽管技术前景广阔,谷歌目前并无大规模量产 Frozen v2 的计划,其产能规模将远低于 TPU。知情人士透露,有限的量产规模使谷歌可以延后引入外部设计和代工合作伙伴。谷歌更将这一代产品视为技术试验平台,待大模型底层架构趋于稳定后,为研发更高专用化芯片积累工程经验。谷歌官方发言人对此回应称,公司各团队“持续研发、测试各类创新技术,力求为用户与企业客户实现极致性能与能效”,并强调“并非所有研发项目都会落地量产,但这种全方位技术探索,是我们全栈自研技术路线的核心一环”。