RECAST:通过多约束数据扩展LLM复杂指令遵循的边界
人工智能
2025-10-07 v4
摘要
大语言模型(LLMs)正越来越期望解决复杂任务,这由其不断扩大的应用场景和用户日益提高的精细化提示能力推动。然而,随着明确要求的数量增加(尤其是超过10个约束),LLMs常常难以准确遵循此类复杂指令,这限制了其在复杂真实场景中的应用。鉴于现有数据集每个实例的约束数不超过10,我们提出RECAST框架,用于合成数据集,其中每个示例包含远超现有基准的约束数量,以挑战并扩展模型遵循复杂指令的能力。这些约束从真实世界的提示-响应对中提取,确保实际相关性。通过该框架,我们构建了RECAST-30K,一个包含30k个实例、覆盖19种约束类型的大规模高质量数据集。实验结果表明,在RECAST-30K上微调的模型在遵循复杂指令方面显著提升,同时保持通用能力而无显著退化。此外,RECAST支持基于规则的验证器对定量约束以及LLM-based验证器对定性约束进行自动验证;RECAST提供的可验证性使能够设计奖励函数用于强化学习,从而进一步提升模型在复杂和具挑战性任务上的性能。
引用
@article{arxiv.2505.19030,
title = {RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data},
author = {Zhengkang Guo and Wenhao Liu and Mingchen Xie and Jingwen Xu and Zisu Huang and Muzhao Tian and Jianhan Xu and Yuanzhe Shen and Qi Qian and Muling Wu and Xiaohua Wang and Changze Lv and He-Da Wang and Hu Yao and Xiaoqing Zheng and Xuanjing Huang},
journal= {arXiv preprint arXiv:2505.19030},
year = {2025}
}