HalluWorld:基于参考世界模型的控制基准用于检测幻觉
计算与语言
2026-05-20 v1 人工智能
机器学习
机器学习
摘要
幻觉仍是大型语言模型的核心失效模式,但现有基准在摘要、问答、检索增强生成和智能体交互等不同情境中操作性不一致。这一碎片化使不清楚哪些缓解措施在一个情境中有效,是否在跨情境中减少幻觉。当前基准要么需要人工标注且固定参考可能被记忆,要么依赖难以复现的情境观察。为研究根本原因,我们引入 HalluWorld,一个基于显式参考世界表述的可扩展基准:当模型生成的可观察论断相对于该世界为假时,即发生幻觉。基于此观点,我们构建合成和准合成环境,使参考世界完全指定,模型的视图受控,幻觉标签自动生成。HalluWorld 覆盖网格世界、象棋和真实终端任务,使我们能够受控地变异世界复杂度、可观察性、时间变化和来源冲突策略,并将幻觉细分为细粒度错误类别。我们评估了前沿和开源权重语言模型在这些情境中的表现,发现一致模式:对于直接观察信息的感知幻觉,前沿模型接近解决;而多步骤状态跟踪和因果前向模拟仍然困难,延长思考并未普遍解决。在终端情境中,模型也在何时选择不作答方面受限。不同探针类型和领域间失败轮廓的不均衡性表明,幻觉源于不同失效模式而非单一能力。我们的结果表明,受控参考世界为衡量和降低现代语言模型中的幻觉提供了可扩展且可复现的路径。
引用
@article{arxiv.2605.19341,
title = {HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models},
author = {Emmy Liu and Varun Gangal and Michael Yu and Zhuofu Tao and Karan Singh and Sachin Kumar and Steven Y. Feng},
journal= {arXiv preprint arXiv:2605.19341},
year = {2026}
}
备注
HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld