中文

基于智能体的检测与解决大语言模型交互中的不完整性与歧义

人工智能 2025-07-08 v1 计算与语言 信息检索

摘要

我们现在许多人将 LLM 当作现代版的神谕几乎可以提出任何问题。然而,咨询 LLM 不必是单轮活动。但是,如果仅通过推理获取上下文信息,长时间的多轮交互会变得繁琐。本文我们考察了使用基于智能体的架构来增强 LLM 基于问题的答复系统的推理能力。我们考察了通过使用 LLM 基于智能体实现的 transducer 自动解决问题中潜在的不完整性或歧义。我们关注几个已知包含这些缺陷的基准数据集。我们为不同的 LLM(GPT-3.5-Turbo 和 Llama-4-Scout)配备了智能体,这些智能体充当检测和解决不完整性和歧义缺陷的专家。这些智能体以零-shot ReAct 智能体的形式实现。与此不同,模型现在决定在 3 种动作之间做出选择:a) 分类 b) 解决 c) 回答。动作 a) 决定问题是否不完整、模糊或正常。动作 b) 确定是否存在可解决的缺陷。动作 c) 回答已解决问题的形式。我们比较了带和不带这些组件的 LLM 的使用情况。我们的结果表明,带有 transducer 的智能体具有以下优势:1) 缩短了与人类交互的轮次 2) 提高了答复质量 3) 对问题中的缺陷提供可解释的解决方案。值得注意的是,我们发现虽然可能导致额外的 LLM 调用以及在某些情况下增加延迟,但在测试数据集上,优势超过成本,除非问题本身已具备足够的上下文。这表明基于智能体的方法可能是一种有用的机制,能够发挥 LLM 的力量,以开发更稳健的 QA 系统。

关键词

引用

@article{arxiv.2507.03726,
  title  = {Agent-Based Detection and Resolution of Incompleteness and Ambiguity in Interactions with Large Language Models},
  author = {Riya Naik and Ashwin Srinivasan and Swati Agarwal and Estrid He},
  journal= {arXiv preprint arXiv:2507.03726},
  year   = {2025}
}

备注

14 pages. arXiv admin note: text overlap with arXiv:2503.17936