工具增强型大语言模型是否能意识到不完整条件?
计算与语言
2025-08-05 v5
摘要
近期将大型语言模型(LLM)与工具集成的进展,使其能够与真实世界环境交互。然而,这些工具增强型 LLM 常常在用户提供部分信息或必要工具不可用时遇到不完整情形。识别和管理此类情形对于确保 LLM 可靠性至关重要,但这一探索仍处于薄弱环节。本研究检验了 LLM 是否能够识别不完整条件,并恰当地确定何时不应使用工具。为量化评估此能力,我们构建了一个新基准数据集,其中实例被系统性地修改以模拟真实交互中常见的模糊和不完整情形。我们的实验表明,即使是最先进的 LLM 也难以识别这些情形,尝试在信息不足或正确工具不可用时使用工具。为更好地理解这些局限性,我们在各种情形下进行了详细的行为分析,包括隐式评估和模型接收到前一次工具调用反馈的情形。基于此分析,我们提出了一种新型的基于提示的推理策略,显式指示模型评估信息充分性和工具可用性。我们的方法显著提高了模型识别不完整情形的能力,导致更具信息性和情境适当性的工具使用决策。我们认为本研究为推动 LLM 可靠性,尤其是在不完整或模糊信息常见的实际应用中作出了重要贡献。本数据集已在 https://huggingface.co/datasets/ddehun/ICT 上提供。
引用
@article{arxiv.2406.12307,
title = {Can Tool-augmented Large Language Models be Aware of Incomplete Conditions?},
author = {Seungbin Yang and ChaeHun Park and Taehee Kim and Jaegul Choo},
journal= {arXiv preprint arXiv:2406.12307},
year = {2025}
}