探索三体注意力核的结构
机器学习
2025-11-18 v1 人工智能
计算与语言
分布式、并行与集群计算
编程语言
摘要
行业和学术界长期以来的目标是开发一个跨硬件架构可移植的 LLM 推理平台,无需低层手工调优,同时仍能实现业界最佳效率。本文展示了跨平台 LLM 推理确实是可能的,并分享我们的实践经验。我们开发了一种基于三体语言(Triton) 的最先进分页注意力核,这是许多 LLM 部署中核心性能关键组件,仅依赖于领域特定即时编译语言,即可在 NVIDIA 和 AMD GPU 上实现最先进性能。我们描述了高层方法、关键算法和系统层面的改进、解锁效率所需的参数自动调优,以及将通用三体注意力核性能从 19.7% 提升到 105.9%所必需的集成方式,这些集成是将性能引入流行推理服务器所必需的。我们的结果突显了如何利用开源领域特定语言来实现跨不同 GPU 供应商的模型可移植性。
引用
@article{arxiv.2511.11581,
title = {The Anatomy of a Triton Attention Kernel},
author = {Burkhard Ringlein and Jan van Lunteren and Radu Stoica and Thomas Parnell},
journal= {arXiv preprint arXiv:2511.11581},
year = {2025}
}