分步骤掌握:增强大型语言模型的软约束遵循能力
计算与语言
2025-06-03 v4 人工智能
摘要
大型语言模型 (LLM) 遵循包含多个约束的指令至关重要。然而,增强 LLM 遵循软约束的能力仍是一个未探索的领域。为弥合这一差距,我们最初设计了一个管道,用于自动构建高质量输出的数据集。此外,鉴于数据构建过程中生成的正负样本, 我们选择直接偏好优化 (Direct Preference Optimization, DPO) 作为训练方法。进一步考虑到软约束难度随约束数量的变化,我们基于约束数量设计了一个基于课程学习的训练范式。我们在实验中评估了所提方法在提升 LLM 软约束遵循能力方面的效果,并分析了推动改进的因素。数据集和代码已公开于 https://github.com/Rainier-rq/FollowSoftConstraint。
引用
@article{arxiv.2501.04945,
title = {Step-by-Step Mastery: Enhancing Soft Constraint Following Ability of Large Language Models},
author = {Qingyu Ren and Jie Zeng and Qianyu He and Jiaqing Liang and Yanghua Xiao and Weikang Zhou and Zeye Sun and Fei Yu},
journal= {arXiv preprint arXiv:2501.04945},
year = {2025}
}