谷歌专为其AI计算设计的半导体TPU的推理优化库“TPU Raiden”已开源到开发者共享网站GitHub。半导体分析公司SemiAnalysis在当地时间9日最先披露了这一消息,并指出“谷歌正越来越多地将TPU软件向外部开放”。
雷电负责的工作,是在AI生成回答的推理过程中,快速在芯片之间传送临时记忆,也就是所谓的KV缓存。
它还包含了在同一台计算机内让芯片之间直接传输、通过网络发送到其他设备,以及把暂时不用的记忆放入普通内存等功能。谷歌表示,这仍是开发中的早期版本,并非正式服务用版本。
雷电的用途,与当下AI服务的运行方式密切相关。AI生成答案的过程可分为两个阶段:
一个是一次性读入整个问题的阶段,另一个是逐字写出回答的阶段。读入阶段计算量大,写出阶段则更耗内存,因此如今的大型服务通常会把这两项工作分配给不同的芯片群组。
这就像后厨分工一样。负责备料和负责烹饪的人各自使用最适合的工具,速度会更快。不过,备料人员整理好的食材必须迅速送到烹饪台,分工的优势才能体现出来。AI中的这类“食材”就是KV缓存,而承担传送任务的软件则是雷电。
在英伟达阵营中,承担相同角色的“NIXL”早已站稳脚跟,并已作为企业运行AI服务时广泛使用的开源工具vLLM的默认组件之一。若雷电也被整合进这类工具中,原本使用英伟达设备运营服务的公司,就有望在不大动干戈的情况下,把同样的工作转移到TPU上。
谷歌过去从未单独销售TPU芯片。若要使用,必须通过谷歌云,而能够高效运行TPU的软件也一直只在搜索和Gemini等自家服务内部使用。近一年的变化尤为明显。谷歌与Anthropic签下了供应100万颗TPU的合约,连模型竞争中的最大对手OpenAI也开始在部分工作中使用TPU。
随着外部客户增加,公开工具变得必要,这被分析为此次开放的根本原因。即便芯片性能更强,如果没有会使用它的工程师、文档和工具,企业也不会离开熟悉的英伟达。外界原本最常见的反对意见就是,不想被不熟悉、没有文档的技术绑定,而公开雷电被解读为正在削弱这道门槛。
不过,局限性也被指出。雷电是TPU专用工具,若不是租用TPU的客户,就没有使用场景。开发者社区里也因此出现了“它像是只对把船带来的人才有用的舵轮”之类的评论。英伟达则一直强调,自家GPU仍领先一代,是唯一能在任何地方运行所有AI模型的平台。
这一格局也与韩国半导体产业并非无关。由于包括TPU在内的AI加速器同样大量使用高带宽存储器(HBM),即便计算芯片竞争从英伟达一家独大转向多极格局,存储器需求仍将持续。因为无论哪个阵营领先,计算芯片旁都必须配备存储器。
谷歌能否通过将积累了10年的英伟达软件生态一块一块公开,逐步追赶上来,仍是接下来的看点。业内评价认为,AI芯片的胜负正在从性能表竞争,转向谁能让开发者用得更顺手的较量。
