云端TPU在有限域密码学中的建筑极限
度量几何
2026-05-26 v1 泛函分析
摘要
我们对云端Tensor Processing Unit(TPU)与GPU在有限域密码学中的成本效益缺口进行经验性表征。相对于A100 GPU基线(cuZK),在FP32尾数存储方案下,v5p和v4架构分别测得的缺口;使用v5p原生int32累加器时,缺口约为。我们对此缺口进行分析,推导出根本算术惩罚(缺乏宽整数ALU)和空间惩罚。我们演示,在并发多租户部署中(严格隔离迫使提前蒙哥马利约化),可得的空间崩溃;放宽此约束可理论上恢复这些空间周期,但底层算术惩罚仍存。为支持此表征,我们部署codename作为测量载体。通过将低阶多项式映射到矩阵形式的Number Theoretic Transform(NTT),调度器将异构多项式堆叠为密集2D矩阵,实现了在统一工作负载下达到约的K维列占用率(混合阶数轨迹上>)。然而,尽管K维打包最优,严重的M维 underutilization(例如v4上为)以及压倒性的VPU绑定蒙哥马利约化导致系统被严重饥饿。事后HLO验证器确保这些测量在XLA融合引擎中保持结构隔离。我们的发现经验性地表明,面向精确高吞吐域算术的AI优化脉动阵列在结构上不足。
引用
@article{arxiv.2605.25366,
title = {A Median Version of Hardy's Inequality},
author = {Gangsong Leng},
journal= {arXiv preprint arXiv:2605.25366},
year = {2026}
}