中文

LLM处理工具输出的能力如何?

机器学习 2026-01-27 v2 人工智能

摘要

大多数现实任务自动化问题需要大型语言模型(LLMs)调用工具,这些工具常常返回复杂的JSON响应。必须进一步处理这些响应以派生完成任务所必需的信息。LLMs的这种能力尚未受到广泛研究。在本文中,我们研究了工具响应处理任务和LLMs处理结构化(JSON)响应的能力。我们创建了一个用于该任务的数据集,并使用多种提示方法评估了15个开放和封闭权重模型。我们的结果表明,即使在多种提示策略下,JSON处理仍然是一项困难的任务,即使对于前沿模型也是如此。最佳响应处理策略取决于工具输出的性质和大小以及所需推理的复杂性。不同的处理方法可能导致性能差异从3%到50%。

关键词

引用

@article{arxiv.2510.15955,
  title  = {How Good Are LLMs at Processing Tool Outputs?},
  author = {Kiran Kate and Yara Rizk and Poulami Ghosh and Ashu Gulati and Tathagata Chakraborti and Zidane Wright and Mayank Agarwal},
  journal= {arXiv preprint arXiv:2510.15955},
  year   = {2026}
}