Hogwild! 推理:通过并发注意力实现并行LLM生成
机器学习
2025-11-18 v4 计算与语言
摘要
大型语言模型(LLM)已展现出通过高级推理、长文本生成和工具使用来处理日益复杂任务的能力。解决这些任务通常涉及较长的推理时间计算。在人类问题解决中,加速工作的常见策略是协作:将问题分解为子任务、并发探索不同策略等。近期研究表明,LLM也可以通过实现显式协作框架(如投票机制或显式创建可并行执行的独立子任务)来并行运行。然而,这些框架可能并不适用于所有类型的任务,从而限制了其适用性。在这项工作中,我们提出了一种不同的设计方法:并行运行LLM“工作线程”,允许它们通过并发更新的注意力缓存进行同步,并提示这些工作线程决定如何最好地协作。我们的方法允许LLM实例针对当前问题自行制定协作策略,同时通过并发KV缓存“看到”彼此的记忆。我们通过Hogwild!推理实现了这种方法:一个并行LLM推理引擎,其中同一LLM的多个实例并行运行,共享相同的注意力缓存,并能“即时”访问彼此的记忆。Hogwild!推理利用旋转位置嵌入(RoPE)来避免重新计算,同时提高并行硬件利用率。我们发现,现代具备推理能力的LLM可以直接使用共享键值缓存进行推理,无需额外微调。
引用
@article{arxiv.2504.06261,
title = {Hogwild! Inference: Parallel LLM Generation via Concurrent Attention},
author = {Gleb Rodionov and Roman Garipov and Alina Shutova and George Yakushev and Erik Schultheis and Vage Egiazarian and Anton Sinitsin and Denis Kuznedelev and Dan Alistarh},
journal= {arXiv preprint arXiv:2504.06261},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025)