单次推理:令牌复制与块稀疏掩码实现多轮推理高效微调
计算与语言
2025-07-14 v2 人工智能
机器学习
摘要
在多轮推理数据集上对大型语言模型(LLM)进行微调,需要由于推理令牌可见性约束,每个对话进行 N(轮数)次独立的前向传播,因为后续轮次中会被丢弃的推理令牌。我们提出一种复制响应令牌并采用自定义注意力掩码的方法,以实现整个对话的单次处理。我们证明了该方法产生的损失与 N 次传递方法完全相同,同时将基于变换器模型的时间复杂性从 降低到 ,且保持相同的内存复杂性。我们的 approach 实现了显著的训练加速,同时保持准确性。我们的实现已在线上提供(https://github.com/devrev/One-Pass-to-Reason)。
引用
@article{arxiv.2504.18246,
title = {One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning},
author = {Ritesh Goru and Shanay Mehta and Prateek Jain},
journal= {arXiv preprint arXiv:2504.18246},
year = {2025}
}
备注
9 pages, 3 figures