中文

UltraIF:从野生数据出发提升指令跟随能力

计算与语言 2025-09-30 v2 人工智能

摘要

指令跟随是使大型语言模型(LLM)成为有用助手的关键,但复杂指令的调控之道仍是谜团,因为开源社区训练的模型与领先公司训练的模型之间存在巨大差距。为弥合这一差距,我们提出了一种简单且可扩展的方法 UltraIF,用以构建能够遵循复杂指令的 LLM,仅使用开源数据。UltraIF 首先将真实世界的用户提示分解为更简单的查询、约束及其对应的评估问题。随后,我们训练 UltraComposer 来组合约束关联的提示与评估问题。这种提示编排器允许我们合成复杂指令,同时用评估问题过滤响应。在实验中,我们首次成功地将 LLaMA-3.1-8B-Base 对齐,其指令跟随能力在 5 个基准测试上达到其 instruct 版本的水平,完全不使用任何基准信息,仅用 8B 参数的模型作为响应生成器与评估器。对齐后的模型在其他基准测试上也取得了竞争成绩。此外,我们还展示 UltraIF 可进一步通过自对齐提升 LLaMA-3.1-8B-Instruct,激发了该方法的更广泛应用前景。我们的代码已公开于 https://github.com/kkk-an/UltraIF。

关键词

引用

@article{arxiv.2502.04153,
  title  = {UltraIF: Advancing Instruction Following from the Wild},
  author = {Kaikai An and Li Sheng and Ganqu Cui and Shuzheng Si and Ning Ding and Yu Cheng and Baobao Chang},
  journal= {arXiv preprint arXiv:2502.04153},
  year   = {2025}
}

备注

Accepted by EMNLP 2025