中文

解构指令遵循:用于细粒度评估大语言模型指令依从能力的新基准

人工智能 2026-01-27 v1

摘要

可靠地确保大语言模型遵循复杂指令是一项关键挑战,因为现有基准通常无法反映实际用途,或无法将依从性与任务成功区分开来。我们引入了 MOSAIC(指令依从性的模块化合成评估),这是一个模块化框架,它使用包含多达 20 个面向应用的生成约束的动态生成数据集,以实现对这种能力的细粒度和独立分析。我们基于这一新基准对来自不同系列的五个 LLMs 进行了评估,结果表明依从性并非单一能力,而是随约束类型、数量和位置的不同而发生显著变化。分析揭示了模型特有的弱点,发现了指令之间的协同与冲突交互作用,并确定了不同的位置偏差,如首因效应和近因效应。这些细粒度的见解对于诊断模型故障和开发更可靠的 LLMs 以满足严格遵循复杂指令的系统需求至关重要。

关键词

引用

@article{arxiv.2601.18554,
  title  = {Deconstructing Instruction-Following: A New Benchmark for Granular Evaluation of Large Language Model Instruction Compliance Abilities},
  author = {Alberto Purpura and Li Wang and Sahil Badyal and Eugenio Beaufrand and Adam Faulkner},
  journal= {arXiv preprint arXiv:2601.18554},
  year   = {2026}
}

备注

Paper accepted to EACL 2026