MIRAGE-Bench:LLM 智能体正在幻听以及如何找到它们
人工智能
2025-07-29 v1
摘要
幻听是大型语言模型 (LLM) 智能体面临的关键风险,常以幻听式动作形式出现,这些动作源于认知上下文中 fabricated 或误解的信息。在最近的研究中,这类失效已被暴露,但现有评估仍零散且缺乏原则性的测试基准。本文提出了 MIRAGE-Bench——Measuring Illusions in Risky AGEnt 设置——这是第一个用于诱发和评估交互式 LLM 智能体幻听的统一基准。我们首先引入三部分分类来解决智能体幻听:基于 (i) 任务指令、(ii) 执行历史或 (iii) 环境观察结果的不忠于任务的动作。为分析,我们首先通过系统审查现有智能体基准来诱发此类失效,然后采用一种将决策点隔离于确定性和可复现方式的快照策略来综合测试用例。为评估幻听行为,我们采用细粒度水平的 LLM-as-a-Judge 范式,配合量身定制的风险感知提示,实现了对智能体动作进行可扩展、高保真度评估,而无需枚举完整的动作空间。MIRAGE-Bench 提供了对 LLM 智能体失效模式的可操作见解,为在交互式环境中缓解幻听问题提供了原则性的基础。
关键词
引用
@article{arxiv.2507.21017,
title = {MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them},
author = {Weichen Zhang and Yiyou Sun and Pohao Huang and Jiayue Pu and Heyue Lin and Dawn Song},
journal= {arXiv preprint arXiv:2507.21017},
year = {2025}
}
备注
Code and data: https://github.com/sunblaze-ucb/mirage-bench.git