HERO-Sign:面向 SPHINCS+ 签名生成的分层调优与高效编译期 GPU 优化
硬件体系结构
2026-01-01 v1
摘要
SPHINCS+ 是一种无状态的基于哈希的签名方案,可提供强大的后量子安全性,但由于密集的哈希计算,其签名生成速度缓慢。GPU 提供了大规模并行性,有望加速 SPHINCS+ 签名。然而,现有的基于 GPU 的优化要么未能充分利用 SPHINCS+ Merkle 树结构固有的并行性,要么缺乏跨其多样化计算内核的细粒度编译器级定制。本文提出了 HERO Sign,一种采用分层调优和高效编译期优化的 GPU 加速 SPHINCS+ 实现。HERO Sign 重新审视了 SPHINCS+ 各组件(包括 FORS、MSS 和 WOTS+)间由数据独立性带来的并行化机会。它为包含大量独立分支的 FORS 引入了树融合策略。该融合策略由自动化的树调优搜索算法指导,使融合方案能够适应不同的 GPU 架构。为了进一步提升性能,HERO Sign 采用了自适应编译策略,该策略考虑了编译器优化在 SPHINCS+ 各内核(如 FORS Sign、TREE Sign 和 WOTS+ Sign)上不同的有效性。在编译期间,该策略会自动在 PTX 和本机代码路径之间进行选择,以最大化效率。对于批量签名生成,HERO Sign 使用基于任务图的构建来优化内核级重叠,从而减少多流空闲时间和内核启动开销。实验结果表明,与 SOTA GPU 实现相比,HERO Sign 在 RTX 4090 上的 SPHINCS+ 128f、192f 和 256f 参数集下分别实现了 1.28-3.13、1.28-2.92 和 1.24-2.60 倍的吞吐量提升。在 A100、H100 和 GTX 2080 上也观察到了类似的收益,同时内核启动延迟降低了两个数量级。
引用
@article{arxiv.2512.23969,
title = {HERO-Sign: Hierarchical Tuning and Efficient Compiler-Time GPU Optimizations for SPHINCS+ Signature Generation},
author = {Yaoyun Zhou and Qian Wang},
journal= {arXiv preprint arXiv:2512.23969},
year = {2026}
}
备注
accepted by HPCA 2026