LsrIF:增强逻辑结构指令遵循的大语言模型方法
人工智能
2026-05-29 v3
摘要
指令遵循是大语言模型的关键任务,但现实指令常涉及多个带有逻辑结构的约束,如并行组合、顺序依赖和条件分支。现有方法通常通过简单组合约束构建数据,训练时对各约束得分求平均,从而忽略逻辑依赖,引入噪声信号。我们提出 LsrIF,一个针对逻辑结构指令遵循的训练框架。LsrIF 将原子约束组织为并行、顺序、条件和嵌套结构,并应用结构感知的奖励聚合,符合其执行语义:对并行约束求平均奖励、在顺序结构中早期失败后对后续奖励进行衰减、在条件结构中仅奖励活跃分支。实验表明,LsrIF 在 both in-domain 和 out-of-domain 设置下均提升了指令遵循能力,同时也有益于逻辑推理。进一步分析表明,逻辑结构的训练增加了对约束相关 token 和逻辑连接词的注意力,表明模型更好地建模了指令逻辑。我们将发布数据和代码供后续研究使用。
引用
@article{arxiv.2601.06431,
title = {LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models},
author = {Qingyu Ren and Qianyu He and Jingwen Chang and Geng Zhang and Jiajie Zhu and Xingzhou Chen and Zhuofei Shi and Jiaqing Liang and Yanghua Xiao and Han Xia and Zeye Sun and Fei Yu},
journal= {arXiv preprint arXiv:2601.06431},
year = {2026}
}