泛化可验证的指令遵循
计算与语言
2025-11-12 v3
摘要
人类与人工智能成功交互的一个关键因素是语言模型或聊天机器人精确遵循人类指令的能力。指令的一个常见特征是输出约束,例如“只用是或否回答”或“至少提到‘abrakadabra’这个词3次”,用户添加这些约束以获得更有用的答案。即使是当今最强的模型也难以满足此类约束。我们发现,大多数模型在测试这些能力的基准测试中,对一小部分可验证约束表现出强烈的过拟合,这种技能被称为精确指令遵循,并且无法很好地泛化到未见过的输出约束。我们引入了一个新的基准测试IFBench,用于评估在58个新的、多样化的且具有挑战性的可验证域外约束上的精确指令遵循泛化能力。此外,我们对模型如何以及在什么数据上进行训练以改进精确指令遵循泛化进行了广泛分析。具体来说,我们精心设计了约束验证模块,并展示了使用可验证奖励的强化学习显著提高了指令遵循能力。除了IFBench,我们还发布了29个额外的新手工标注的训练约束和验证函数、强化学习训练提示和代码。
引用
@article{arxiv.2507.02833,
title = {Generalizing Verifiable Instruction Following},
author = {Valentina Pyatkin and Saumya Malik and Victoria Graf and Hamish Ivison and Shengyi Huang and Pradeep Dasigi and Nathan Lambert and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2507.02833},
year = {2025}
}
备注
11 pages, accepted to NeurIPS 2025, Datasets & Benchmarks