GOOGLNVDAAAPLMSFTAVGO

AI Infra 2026:从“脑力”竞争转向“全身”进化

FUNDA·2026年4月14日

Google's TPU vertical stack slashes TCO; Anthropic buys gigawatts; v8x ships Q4'26, pressuring Nvidia GPUs.

2026 年,AI 发展已从追求benchmark取得高分,正式转向追求具备多步骤推理与行动能力的AI Agent 。这场基础设施的军备竞赛,正经历一场类似生物进化的转型。如果将 AI 系统比作一个演进中的生命体:GPU/TPU 是负责运算的大脑,Memory 与 Storage 是存放经验与上下文的记忆载体,CPU 是协调任务的双手,而 Optics 与 Networking 则是支撑全身数据流转、反应灵敏度的四肢。在 Agent Scaling Law 的框架下,我们观察到核心瓶颈已不再仅是单颗晶片的浮点运算能力(脑力),而是整套系统的通讯效率(四肢)、记忆体墙(记忆)以及总持有成本(TCO) 。

  • 「大脑」的闲置危机: 即便拥有最强的运算核心,若通讯「四肢」不发达,晶片将有超过 1/3 的时间处于等待数据的闲置状态 。
  • 「记忆」的读取瓶颈: Agent 的长序列推理对 KV Cache 的管理提出了苛刻要求,记忆体与储存组件的效能已成为决定 Agent 逻辑深度的关键 。
  • 「四肢」的升维演进: 为了克服 MoE 架构带来的通讯瓶颈,基础设施正推动从 3D Torus 向高维度(最高 10D)升维,网路投资的权重正在赶上什至超越运算晶片本身 。

本报告前半段将概述AI Agent遇到的瓶颈以及近期TPU的进展,而后半段将深入探讨 Google TPU 如何透过垂直整合优化「全身器官」的协调效率,并论证:

  1. Networking 成为核心战场: 为了克服 MoE 架构带来的 All-to-All 通讯瓶颈,Google 正显著扩张 Scale-out 网路带宽,并推动从 3D Torus 向高维度升维。
  2. TCO 与配置效率释放: TPU 透过自研架构与垂直整合,其TPU v7 机柜成本大幅低於 NVIDIA GB200 。这种效率释放为光通讯与记忆体腾出了更大的成长空间 。

Agent Scaling Law

Continue reading with FUNDA

This report is available to subscribers. Sign in or subscribe to read the full analysis.