中文

WildIFEval:真实场景下的指令遵循

计算与语言 2025-10-08 v2 人工智能

摘要

近期的 LLM 在遵循用户指令方面展现出了显著的成功,然而处理具有多重约束的指令仍然是一个重大挑战。在这项工作中,我们引入了 WildIFEval——一个包含 7K 条具有多样化、多约束条件的真实用户指令的大规模数据集。与以往的数据集不同,我们的合集涵盖了从自然用户指令中提取的广泛的词汇和主题约束范围。我们将这些约束分为八个高级类别,以捕捉它们在真实场景中的分布与动态。利用 WildIFEval,我们进行了广泛的实验,对领先的 LLM 的指令遵循能力进行了基准测试。WildIFEval 清晰地区分了小型和大型模型,并表明所有模型在此类任务上都有很大的改进空间。我们分析了约束数量和类型对性能的影响,揭示了模型约束遵循行为的有趣模式。我们发布了我们的数据集,以促进在复杂、真实条件下的指令遵循的进一步研究。

关键词

引用

@article{arxiv.2503.06573,
  title  = {WildIFEval: Instruction Following in the Wild},
  author = {Gili Lior and Asaf Yehudai and Ariel Gera and Liat Ein-Dor},
  journal= {arXiv preprint arXiv:2503.06573},
  year   = {2025}
}