中文

张量训练在TPU、GPU与CPU架构上的性能基准测试:面向加速量子灵感同质化

材料科学 2025-12-10 v2

摘要

近期高分辨率CT成像技术的发展正在创建一类超高分辨率微观结构数据集,这挑战了传统同质化方法的极限。虽然基于FFT的同质化技术对中等数据集仍然有效,但其内存占用和计算成本随分辨率提升而快速增长,使得其在工业规模问题中变得越来越不高效。为应对这些挑战,最近开发的基于SFFT(超快速傅里叶变换)的同质化算法利用张量训练(TT)的内存高效低秩表示,降低了大规模同质化问题的存储和计算要求。虽然SFFT基于同质化算法最初开发用于CPU使用,能够高效处理高分辨率数据集,但假设底层数据良好。本文我们调查了在现代硬件加速器上进行基本TT操作的性能,使用JAX框架进行基准测试。本基准测试研究比较了CPU、GPU和TPU,评估执行时间和计算效率。基于这些见识,我们将SFFT基于同质化算法 adapted for usage on accelerators,实现了最高可达10倍的速度提升,相对于CPU实现,从而为处理此前不可行的数据集大小 paving the road。我们的结果显示,GPU和TPU在现实场景中实现了相当 comparable performance,尽管TPU生态系统相对不成熟,两者都展示了加速量子灵感技术以加快工业规模模拟,特别是针对同质化问题的潜力。

关键词

引用

@article{arxiv.2512.07811,
  title  = {Performance Benchmarking of Tensor Trains for accelerated Quantum-Inspired Homogenization on TPU, GPU and CPU architectures},
  author = {Sascha H. Hauck and Matthias Kabel and Nicolas R. Gauger},
  journal= {arXiv preprint arXiv:2512.07811},
  year   = {2025}
}