发布成功


谷歌发布第八代TPU:分训练与推理两款独立芯片

发布时间:2026-04-23 阅读量:4090 来源: 发布人: suii

在4月22日举行的Google Cloud Next 2026大会上,谷歌(GOOGL-US)正式推出其第八代张量处理器(TPU)的两款新型号:TPU 8t专为AI模型训练设计,TPU 8i则专注于推理任务优化。这是谷歌首次将训练与推理拆分为独立芯片,标志着其AI硬件战略的重大转向。


图片2.png


谷歌两款芯片均打算在今年稍晚正式对外供应,旨在透过专项优化应对日益分化的 AI 工作负载,并以更具成本效益的方式提供大规模吞吐量和低延迟,满足数百万个 AI 智能体同时运行的需求。


谷歌此次战略调整是对 AI 计算特性分化的直接回应。随着 AI 智能体兴起,预训练、后训练与即时推理在运算需求上已显著不同;训练任务追求极致的吞吐量与规模扩展,而推理任务则对延迟和并发更为敏感。


谷歌资深副总裁兼 AI 与基础设施技术长 Amin Vahdat 指出,业界将受惠于针对这两类需求专门优化的芯片。


Alphabet 执行长皮查伊也强调,这项架构旨在以低成本提供大规模算力。从市场角度来看,统一芯片往往导致某一场景下的资源浪费,而双芯片策略能显著提升价格效能比,降低云端 AI 基础设施的整体拥有成本。


在效能数据上,第八代 TPU 相比去年 11 月发布的第七代 Ironwood 有了巨大飞跃。 TPU 8t 在同等价格下效能提升 2.8 倍,TPU 8i 效能提升 80%,两款芯片的能源效率表现特别亮眼。


TPU 8t 定位为超大规模训练的算力引擎,号称能将前沿模型的开发周期从数月压缩至数周。在规模上,它最多可将 9600 块芯片组合为单一超级运算节点,并透过 JAX 与 Pathways 框架将分散式训练扩展至单一集群超过 100 万块芯片,其核心技术创新包括:专门处理嵌入查找的 SparseCore 加速器、原生 FP4 支援 (使 MXU 吞吐量翻倍并降低能耗),以及更均衡的向量处理单元扩展设计。


TPU 8i 则面向高并发推理场景,重心在于降低延迟与提升并发处理能力,其最显著的硬体特征是整合了 384MB 静态随机存取存储器,容量是上一代的三倍,可将更大的 KV Cache 保留在片上,大幅减少长上下文解码的等待时间。


此外,它引入了集合加速引擎 (CAE),专门加速自回归解码与思维链处理,使片上集合操作延迟降低 5 倍。在网路拓扑上,TPU 8i 放弃了传统的 3D 环面结构,转而采用全新的 Boardfly 互联拓扑,将最大跳数压缩至 7 跳,全对全通讯延迟改善最高 50%。


此次发布不仅展示谷歌在芯片设计上的技术深度,也反映其供应链策略的调整。TPU 8t 由博通共同设计,主打极致性能,TPU 8i 则首次牵手联发科,旨在优化成本与效率。


《华尔街见闻》分析指出,谷歌此次采用的双芯片策略使其能够针对训练与推理任务分别深度优化,在实现性能与成本平衡的同时,也通过多供应商布局降低了对单一供应链的依赖与溢价风险。


相关资讯
AEC-Q100 Grade 0 认证,纳芯微 NSM2025 电流传感器适配紧凑化新能源车电驱设计

纳芯微发布车规级线性电流传感器 NSM2025,搭载自研 BendingMag™聚磁技术,器件集成集磁片,搭配外部 U 型磁芯使用,符合 AEC-Q100 Grade 0 车规标准。针对新能源汽车电驱系统大电流检测、安装空间紧张的痛点,该产品支持和 PCB、母排灵活组合装配,适用于新能源车电机逆变器、BMS 以及各类过流检测场景。

是德科技推出 20GHz PSG XG7 双通道模拟信号发生器

是德科技推出全新 XG7 系列 PSG 模拟信号发生器,最高频率可达 20 GHz。这款仪器采用 2U 单机箱架构,内部搭载两路相互独立的信号通道,拥有优异低噪声性能与校准输出功率,便于工程师精准完成器件性能评估。紧凑双通道方案无需额外占用机架空间,有效提升测试容量。

是德科技助力加利福尼亚大学伯克利分校推进6G空口测试研究

是德科技助力加利福尼亚大学伯克利分校推进6G空口测试研究

苹果也受不了内存太贵,传iPhone 18 Pro系列10月减单15%

苹果iPhone系列手机10月订单较最初要求减少至15%!

传英伟达将不再向 GeForce 游戏显卡分配 GB202 GPU

英伟达将不再向GeForce RTX 50 系列游戏显卡分配 GB202,该 GPU 的供应将由 RTX PRO Blackwell 专业显卡独占。