中文

论指令微调损失对泛化能力的影响

计算与语言 2025-07-16 v2 人工智能 机器学习

摘要

指令微调已成为一种关键的训练后范式,使预训练语言模型能够更好地遵循用户指令。尽管其意义重大,但用于优化损失函数的研究并未受到太多关注。一个基本却常被忽视的问题是:传统的自回归目标——即损失仅在响应 token 上计算,排除提示 token——是否真正最优适用于指令微调。在本研究中,我们系统地研究了在指令微调损失中对提示 token 和响应 token 进行差异化加权的影响,并提出了加权指令微调作为传统指令微调的更优替代方案。通过在不同家族和规模的五个语言模型、三个不同规模的数据集以及五个多样化的评估基准上进行广泛实验,我们表明标准的指令微调损失通常产生次优性能,且对输入提示变化的鲁棒性有限。我们发现,为提示 token 分配低至中等权重,同时为响应 token 分配中至高权重,能够在各种设置下产生性能最佳的模型,并且也能作为后续偏好对齐训练的更好起点。这些发现突显了重新审视指令微调损失的必要性,并为开发更鲁棒、更具泛化能力的模型提供了可操作的见解。我们的代码已在 https://github.com/kowndinya-renduchintala/WIT 开源。

关键词

引用

@article{arxiv.2507.07817,
  title  = {On the Effect of Instruction Tuning Loss on Generalization},
  author = {Anwoy Chatterjee and H S V N S Kowndinya Renduchintala and Sumit Bhatia and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2507.07817},
  year   = {2025}
}

备注

To appear in Transactions of the Association for Computational Linguistics (TACL)