IOPO: 通过输入-输出偏好优化增强LLM的复杂指令遵循能力
计算与语言
2025-07-18 v3 人工智能
摘要
在大语言模型(LLMs)领域,模型准确遵循指令的能力至关重要,因为越来越多的代理和应用利用LLMs进行构建,其中指令的复杂性正在迅速增加。然而,一方面,复杂的指令评估数据只有一定数量;另一方面,没有专门的算法来提升遵循复杂指令的能力。为此,本文引入了TRACE,一个用于提升和评估复杂指令遵循能力的基准,包含12万条训练数据和1千条评估数据。此外,我们提出了IOPO(输入-输出偏好优化)对齐方法,该方法同时考虑输入和输出偏好对,其中LLMs不仅快速对齐响应偏好,还细致地探索指令偏好。在域内和域外数据集上的大量实验证实了IOPO的有效性,与SFT和DPO相比,在域内数据上分别提升了8.15%和2.18%,在域外数据上分别提升了6.29%和3.13%。
引用
@article{arxiv.2411.06208,
title = {IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization},
author = {Xinghua Zhang and Haiyang Yu and Cheng Fu and Fei Huang and Yongbin Li},
journal= {arXiv preprint arXiv:2411.06208},
year = {2025}
}
备注
ACL 2025