中文

SIFo 基准:探讨大型语言模型的顺序指令跟随能力

计算与语言 2025-12-12 v2

摘要

跟随多个指令是大型语言模型(LLM)的关键能力。评估这一能力面临着显著挑战:(i) 多个指令之间的关联性有限,(ii) 位置偏差,即指令顺序会影响模型性能,以及 (iii) 缺乏可客观验证的任务。为此,我们引入了一个旨在评估模型是否能通过顺序指令跟随(SIFo)任务来跟随多个指令的基准测试。在 SIFo 中,多个指令的成功完成可以通过仅检查最终指令来验证。我们的基准测试使用四个任务(文本修改、问答、数学和安全规则),每个任务都评估顺序指令跟随的不同方面。我们对流行的大型语言模型(包括封闭源和开源模型)进行了评估,结果显示,较新且规模更大的模型在 SIFo 任务上显著优于其较旧和较小的版本,验证了基准测试的有效性。所有模型在跟随指令序列方面都表现不佳,这暗示了当今语言模型存在重要的鲁棒性不足。

关键词

引用

@article{arxiv.2406.19999,
  title  = {The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models},
  author = {Xinyi Chen and Baohao Liao and Jirui Qi and Panagiotis Eustratiadis and Christof Monz and Arianna Bisazza and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2406.19999},
  year   = {2025}
}

备注

EMNLP 2024 Findings