学会提问:当LLM智能体遇到不清晰指令
计算与语言
2026-04-30 v4 人工智能
软件工程
摘要
现代大型语言模型(LLM)配备了调用函数的能力,可以利用外部工具来解决一系列仅靠语言技能无法完成的任务。然而,这些工具的有效执行不仅严重依赖于LLM的先进能力,还依赖于精确的用户指令,而这在现实世界中往往无法保证。为了评估LLM在不完美指令下的工具使用性能,我们仔细检查了用户查询的真实世界指令,分析了错误模式,并构建了一个名为NoisyToolBench的具有挑战性的工具使用基准。我们发现,由于下一个词元预测的训练目标,LLM倾向于随意生成缺失的参数,这可能导致幻觉和风险。为了解决这个问题,我们提出了一个新的框架,按需提问(AwN),该框架促使LLM在遇到因指令不清晰而导致的障碍时向用户提问。此外,为了减少用户与LLM交互中的人工劳动,并从准确性和效率两个角度评估LLM在工具使用方面的性能,我们设计了一个名为ToolEvaluator的自动化评估工具。我们的实验表明,在NoisyToolBench中,AwN显著优于现有的工具学习框架。我们将发布所有相关代码和数据集以支持未来的研究。
引用
@article{arxiv.2409.00557,
title = {Learning to Ask: When LLM Agents Meet Unclear Instruction},
author = {Wenxuan Wang and Juluan Shi and Zixuan Ling and Yuk-Kit Chan and Chaozheng Wang and Cheryl Lee and Youliang Yuan and Jen-tse Huang and Wenxiang Jiao and Michael R. Lyu},
journal= {arXiv preprint arXiv:2409.00557},
year = {2026}
}
备注
EMNLP 2025