AgentHallu: 自动归因 LLM-based 智能体的幻觉基准
计算与语言
2026-01-13 v1
摘要
由于 LLM-based 智能体在顺序多步骤推理中运行,来自中间步骤的幻觉风险会沿着轨迹传播,从而降低整体可靠性。与单轮响应的幻觉检测不同,对多步骤工作流程的诊断需要识别导致初始偏离的具体步骤。为填补这一空白,我们提出一种新研究任务,即 LLM-based 智能体的自动幻觉归因,旨在识别负责幻觉的步骤并解释原因。为支持该任务,我们引入 AgentHallu,一个综合性基准,包含:(1)跨越 7 个智能体框架和 5 个领域的 693 条高质量轨迹;(2)组织为 5 类(规划、检索、推理、人类互动和工具使用)和 14 子类的幻觉分类体系;(3)由人类策划的多层级注释,涵盖二元标签、幻觉负责步骤和因果解释。我们评估了 13 个领先模型,结果显示该任务即使对顶尖模型(如 GPT-5、Gemini-2.5-Pro)也是具备挑战性的。最佳表现模型仅实现 41.1% 的步骤局部化准确率,其中工具使用幻觉最具挑战性,仅为 11.6%。我们相信 AgentHallu 将催化未来研究,以开发健壮、透明且可靠的智能体系统。
关键词
引用
@article{arxiv.2601.06818,
title = {AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents},
author = {Xuannan Liu and Xiao Yang and Zekun Li and Peipei Li and Ran He},
journal= {arXiv preprint arXiv:2601.06818},
year = {2026}
}
备注
Project page: https://liuxuannan.github.io/AgentHallu.github.io/