中文

指令数量多少:衡量和估计 LLM 多指令跟随能力

计算与语言 2025-09-26 v1

摘要

随着大语言模型(LLM)越来越多地应用于实际场景,理解它们同时遵循多个指令的能力变得至关重要。为系统评估这些能力,我们引入了两个专门的基准测试,用于基本领域,其中多指令跟随尤为重要:Many Instruction-Following Eval(ManyIFEval)用于最多包含十个指令的文本生成,以及 Style-aware Mostly Basic Programming Problems(StyleMBPP)用于最多包含六个指令的代码生成。我们使用所创建的基准测试对十个 LLM 进行实验,发现随着指令数量的增加,性能始终会下降。此外,鉴于在实际应用中评估所有可能的多指令组合在计算上是不可行的,我们开发了三种回归模型,用于估计未见过的指令组合以及不同于训练期间使用的指令数量的性能。我们展示,使用指令计数作为解释变量的逻辑回归模型可以以约 10% 的误差预测跟随多个指令的性能,甚至对于未见过的指令组合也是如此。我们表明,对于 ManyIFEval(500 个样本)和 StyleMBPP(300 个样本),相对适中的样本量就足够进行性能估计, enabling 在 various instruction combinations 下高效评估 LLM。

关键词

引用

@article{arxiv.2509.21051,
  title  = {When Instructions Multiply: Measuring and Estimating LLM Capabilities of Multiple Instructions Following},
  author = {Keno Harada and Yudai Yamazaki and Masachika Taniguchi and Edison Marrese-Taylor and Takeshi Kojima and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2509.21051},
  year   = {2025}
}

备注

Accepted to EMNLP2025