工具增强型语言模型中的基准测试失效
软件工程
2025-03-19 v1 计算与语言
摘要
工具的集成已将语言模型 (LM) 的能力从纯文本生成扩展到多种场景。然而,工具增强型语言模型 (TaLMs) 常常假设信息获取和工具可用性为完美,这在现实世界中往往不成立。为系统研究 TaLMs 的不完美现象,我们引入了 FAIL-TALMS 基准测试,包含两个主要失效模式:用户查询不完整和工具不可用。FAIL-TALMS 包含 1,749 个示例,使用 906 个工具覆盖 21 个类别,包括单工具和多工具使用。我们评估了顶尖的专有和开源模型,发现除 Claude 外的所有当前模型都难以识别缺失的工具或信息。进一步地,为研究可能的缓解措施,我们启用了实时人类交互,称为 Ask-and-Help (AAH) 方法,以提供缺失信息或替换不可用工具。尽管 AAH 在查询不完整时可以帮助模型更正确地解决任务,但在复杂工具损坏时几乎没有帮助。
引用
@article{arxiv.2503.14227,
title = {Benchmarking Failures in Tool-Augmented Language Models},
author = {Eduardo Treviño and Hugo Contant and James Ngai and Graham Neubig and Zora Zhiruo Wang},
journal= {arXiv preprint arXiv:2503.14227},
year = {2025}
}