约束回译提升大型语言模型对复杂指令的遵循能力
计算与语言
2025-04-30 v2 人工智能
摘要
大型语言模型(LLMs)在遵循格式、长度等方面的复杂指令时存在困难。遵循传统的指令微调实践,先前工作通过将复杂指令输入先进LLMs来生成复杂指令-响应对,从而进行后训练。然而,即使先进的LLMs也无法很好地遵循复杂指令,从而限制了生成数据的质量。在本工作中,我们发现现有数据集本质上包含隐式的复杂约束,并提出了一种新颖的数据生成技术——约束回译。具体而言,我们采用现有数据集中的高质量指令-响应对,仅使用先进LLMs将响应中已满足的复杂约束添加到指令中,这自然地降低了成本和数据噪声。在实验中,我们采用Llama3-70B-Instruct进行约束回译,创建了一个高质量的复杂指令-响应数据集CRAB。我们展示了在CRAB上进行后训练可以提升多种基础LLMs的复杂指令遵循能力,并在广泛的指令遵循基准上进行了评估。我们进一步发现,约束回译也可以作为后训练中有用的辅助训练目标。我们的代码、数据和模型将公开发布,以促进未来研究。
引用
@article{arxiv.2410.24175,
title = {Constraint Back-translation Improves Complex Instruction Following of Large Language Models},
author = {Yunjia Qi and Hao Peng and Xiaozhi Wang and Bin Xu and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2410.24175},
year = {2025}
}
备注
14 pages, 6 figures