基于数据库问答评估 LLM 智能体中推理与行动集成的研究
计算与语言
2023-11-17 v1
摘要
本研究引入了一个新的长形式数据库问答数据集,旨在评估大语言模型(LLMs)与 SQL 解释器的交互方式。该任务要求 LLM 策略性地生成多个 SQL 查询以从数据库中检索充足数据,对所获上下文进行推理,并将其综合为一份全面的分析性叙述。我们的发现强调,即便对于最先进的 GPT-4 模型,该任务也构成了巨大挑战。我们提出并评估了两种交互策略,并对交互中的各个阶段进行了细粒度分析。一个关键发现是识别出了阻碍有效交互的两个主要瓶颈:规划能力以及生成多个 SQL 查询的能力。为解决准确评估答案质量的难题,我们引入了一个多智能体评估框架,其模拟学术同行评审过程,从而提升了评估的精确性与可靠性。该框架使得我们能够更细致地理解当前 LLM 在复杂检索与推理任务中的优势与局限。
引用
@article{arxiv.2311.09721,
title = {On Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering},
author = {Linyong Nan and Ellen Zhang and Weijin Zou and Yilun Zhao and Wenfei Zhou and Arman Cohan},
journal= {arXiv preprint arXiv:2311.09721},
year = {2023}
}