中文

单次推理:令牌复制与块稀疏掩码实现多轮推理高效微调

计算与语言 2025-07-14 v2 人工智能 机器学习

摘要

在多轮推理数据集上对大型语言模型(LLM)进行微调,需要由于推理令牌可见性约束,每个对话进行 N(轮数)次独立的前向传播,因为后续轮次中会被丢弃的推理令牌。我们提出一种复制响应令牌并采用自定义注意力掩码的方法,以实现整个对话的单次处理。我们证明了该方法产生的损失与 N 次传递方法完全相同,同时将基于变换器模型的时间复杂性从 O(N3)O\bigl(N^{3}\bigr) 降低到 O(N2)O\bigl(N^{2}\bigr),且保持相同的内存复杂性。我们的 approach 实现了显著的训练加速,同时保持准确性。我们的实现已在线上提供(https://github.com/devrev/One-Pass-to-Reason)。

关键词

引用

@article{arxiv.2504.18246,
  title  = {One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning},
  author = {Ritesh Goru and Shanay Mehta and Prateek Jain},
  journal= {arXiv preprint arXiv:2504.18246},
  year   = {2025}
}

备注

9 pages, 3 figures