中文

AGENTIF:大型语言模型在代理情景下的指令遵循基准测试

人工智能 2025-05-23 v1 计算与语言

摘要

大型语言模型(LLM)在实际agentic应用中展现出先进能力。不断涌现的研究旨在开发基于 LLM 的agent以满足实际需求,引入了新挑战:agent情景常涉及长度较长且约束复杂的指令,例如较长的系统提示和详细的工具规格。虽然遵循此类指令对于agent应用至关重要,但 LLM 是否可靠遵循这些指令仍未得到充分探讨。本文引入 AgentIF,第一个系统性评估 LLM 在agent情景下指令遵循能力的基准。AgentIF具有三个关键特征:(1)真实可靠,源自 50 个真实agentic应用;(2)长度较长,平均为 1723 字,最长达 15630 字;(3)约束复杂,平均为 11.9 个约束/指令,涵盖多种约束类型,如工具规格和条件约束。为构建 AgentIF,我们收集了来自工业应用agent和开源agent系统的 707 条人工标注指令,涵盖 50 个agentic任务。对每条指令,我们标注其关联约束及相应评估指标,包括基于代码的评估、基于 LLM 的评估及混合代码-LLM 评估。我们使用 AgentIF 对现有先进 LLM 进行系统性评估。我们发现当前模型总体表现较差,尤其在处理复杂约束结构和工具规格方面。我们进一步对指令长度和meta约束进行错误分析和分析实验,提供了关于现有 LLM 失败模式的一些发现。我们已发布代码和数据以促进未来研究。

关键词

引用

@article{arxiv.2505.16944,
  title  = {AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios},
  author = {Yunjia Qi and Hao Peng and Xiaozhi Wang and Amy Xin and Youfeng Liu and Bin Xu and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2505.16944},
  year   = {2025}
}