基于工具调用后反思与检索增强生成的工具调用修复
软件工程
2025-10-22 v1 人工智能
摘要
智能体系统通过调用 Python 函数、REST API 端点或如 Kubernetes 中的 kubectl 命令行工具等外部工具与外部系统交互。这些工具调用常因语法和语义原因而失败。一些不那么明显的语义错误只能在分析工具响应后才能识别和解决。为修复这些错误,我们开发了一个基于工具调用后反思的组件,将大语言模型(LLM)驱动的反思与使用描述所调用特定工具及其相关故障排查文档的领域特定检索增强生成(RAG)相结合。本文聚焦于 kubectl 命令行工具以管理 Kubernetes—a 用于编排集群应用的平台。通过更大规模的实证研究和较小规模的手动评估,我们发现该 RAG 基于反射的修复方法能够使 kubectl 命令在被评估的 55% 的模型中更可能成功执行(通过率),并且平均比正确回答用户查询的概率高出 36%。我们发现与官方文档相比,使用故障排查文档可提高通过率,平均提升 10%。
引用
@article{arxiv.2510.17874,
title = {Repairing Tool Calls Using Post-tool Execution Reflection and RAG},
author = {Jason Tsay and Zidane Wright and Gaodan Fang and Kiran Kate and Saurabh Jha and Yara Rizk},
journal= {arXiv preprint arXiv:2510.17874},
year = {2025}
}