基于 hls4ml 的 FPGA 低延迟 Transformer 推理及其在物理学中的应用
机器学习
2024-09-10 v1
摘要
本研究展示了使用 hls4ml 在现场可编程门阵列 (FPGA) 上高效实现 Transformer 架构的方法。我们演示了实现多头注意力、softmax 和归一化层的策略,并评估了三个不同的模型。它们在 VU13P FPGA 芯片上的部署实现了低于 2 微秒的延迟,展示了其在实时应用中的潜力。hls4ml 与任何基于 TensorFlow 构建的 Transformer 模型的兼容性进一步增强了本工作的可扩展性和适用性。索引术语:FPGA、机器学习、Transformer、高能物理、LIGO
关键词
引用
@article{arxiv.2409.05207,
title = {Low Latency Transformer Inference on FPGAs for Physics Applications with hls4ml},
author = {Zhixing Jiang and Dennis Yin and Yihui Chen and Elham E Khoda and Scott Hauck and Shih-Chieh Hsu and Ekaterina Govorkova and Philip Harris and Vladimir Loncar and Eric A. Moreno},
journal= {arXiv preprint arXiv:2409.05207},
year = {2024}
}