中文

大语言模型函数调用中的指令遵循评估

人工智能 2025-09-24 v1

摘要

函数调用是大语言模型的核心能力,对于 AI 智能体至关重要。现有基准测试如伯克利函数调用排行榜(BFCL)、tau^2-Bench(arXiv:2506.07982)和 ACEBench(arXiv:2501.12851)评估参数正确性,但不测试对参数描述中嵌入的格式指令的遵循情况,例如将值括在双引号中或使用 ISO 日期格式。我们引入 IFEval-FC,灵感来自 IFEval(arXiv:2311.07911),用于评估函数调用中的精确指令遵循。IFEval-FC 将可验证的格式直接编码在 JSON schema 描述中,例如指定值不能包含标点。它包含 750 个测试案例,每个测试案例由一个带有输入参数格式嵌入的函数和对应的用户查询组成。评估完全是算法化的,确保客观性、可重复性和可扩展性。我们的结果表明,即使是最先进的专有模型,包括 GPT-5 和 Claude 4.1 Opus,也经常无法遵循基本格式规则,这在现实智能体系统中是一个实际限制。完整的代码和数据已公开于 https://github.com/Skripkon/IFEval-FC。

关键词

引用

@article{arxiv.2509.18420,
  title  = {Instruction-Following Evaluation in Function Calling for Large Language Models},
  author = {Nikolai Skripko},
  journal= {arXiv preprint arXiv:2509.18420},
  year   = {2025}
}