中文

云端TPU在有限域密码学中的建筑极限

度量几何 2026-05-26 v1 泛函分析

摘要

我们对云端Tensor Processing Unit(TPU)与GPU在有限域密码学中的成本效益缺口进行经验性表征。相对于A100 GPU基线(cuZK),在FP32尾数存储方案下,v5p和v4架构分别测得[5,558×,6,908×][5{,}558\times, 6{,}908\times]的缺口;使用v5p原生int32累加器时,缺口约为4,693×4{,}693\times。我们对此缺口进行分析,推导出根本算术惩罚(缺乏宽整数ALU)和空间惩罚。我们演示,在并发多租户部署中(严格隔离迫使提前蒙哥马利约化),可得5.19×5.19\times的空间崩溃;放宽此约束可理论上恢复这些空间周期,但底层算术惩罚仍存。为支持此表征,我们部署codename作为测量载体。通过将低阶多项式映射到矩阵形式的Number Theoretic Transform(NTT),调度器将异构多项式堆叠为密集2D矩阵,实现了在统一工作负载下达到约100%100\%的K维列占用率(混合阶数轨迹上>92%92\%)。然而,尽管K维打包最优,严重的M维 underutilization(例如v4上为6.25%6.25\%)以及压倒性的VPU绑定蒙哥马利约化导致系统被严重饥饿。事后HLO验证器确保这些测量在XLA融合引擎中保持结构隔离。我们的发现经验性地表明,面向精确高吞吐域算术的AI优化脉动阵列在结构上不足。

关键词

引用

@article{arxiv.2605.25366,
  title  = {A Median Version of Hardy's Inequality},
  author = {Gangsong Leng},
  journal= {arXiv preprint arXiv:2605.25366},
  year   = {2026}
}