中文

ThreadWeaver:高效平行推理中自适应线程编织技术

机器学习 2025-12-10 v1 人工智能 计算与语言

摘要

扩大推理计算规模使大语言模型(LLM)在推理性能上取得显著成果,但固有的顺序解码方式在复杂任务上导致较高延迟,尤其在数学推理等需要深度链式思考(chain-of-thought, CoT)的场景中表现突出。近期研究通过在有益时将问题解决过程分解为并行推理线程来提升推理效率,但现有方法在真实任务上要么受限于监督行为克隆,要么与广泛采用的顺序长链CoT基线相比精度显著下降。此外,许多方法需要定制推理引擎,增加部署复杂度。我们提出ThreadWeaver,一种实现与主流顺序推理模型相当精度的自适应平行推理框架,同时显著降低推理延迟。ThreadWeaver的性能源于三项关键创新:1)一种两阶段平行轨迹生成器,产生大规模高质量CoT数据并标注平行信息用于监督微调;2)一种基于Trie的训练-推理联合设计,使其能在无需修改位置嵌入或KV缓存的前向自回归推理引擎上实现平行推理;3)一种面向平行化的强化学习框架,教会模型在准确率与有效平行化之间进行权衡。在六项具有挑战性的数学推理基准测试中,ThreadWeaver基于Qwen3-8B训练后,在平均71.9%(AIME24上达到79.9%)的准确率下,实现了约1.53倍的token延迟加速,建立了准确率与效率之间的新Pareto前沿。

关键词

引用

@article{arxiv.2512.07843,
  title  = {ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models},
  author = {Long Lian and Sida Wang and Felix Juefei-Xu and Tsu-Jui Fu and Xiuyu Li and Adam Yala and Trevor Darrell and Alane Suhr and Yuandong Tian and Xi Victoria Lin},
  journal= {arXiv preprint arXiv:2512.07843},
  year   = {2025}
}