中文

引导多模态AI幻觉的可验证性

人工智能 2026-04-09 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

由多模态大语言模型(MLLMs)驱动的AI应用容易产生幻觉,并对人类用户构成相当大的风险。关键在于,这类幻觉并非同等严重:某些幻觉内容可被人类用户察觉(即明显幻觉),而另一些则常被忽略或需要更多验证努力(即难以察觉的幻觉)。这表明多模态AI幻觉在可验证性上存在显著差异。然而,很少有研究探讨如何针对具有不同安全性和可用性需求的AI应用来控制这一属性。为弥补这一空白,我们从4,470条人类对AI生成幻觉的响应中构建了一个数据集,并根据人类用户的可验证性将这些幻觉分为明显型和难以察觉型。此外,我们提出了一种激活空间干预方法,为明显幻觉和难以察觉幻觉分别学习独立的探针。我们揭示出,明显幻觉与难以察觉幻觉会引发不同的干预探针,从而能够对模型的可验证性进行细粒度控制。实证结果证明了该方法的有效性,并表明针对性干预在调节相应可验证性方面表现出优越性能。此外,简单混合这些干预措施即可灵活控制不同场景所需的可验证性。

关键词

引用

@article{arxiv.2604.06714,
  title  = {Steering the Verifiability of Multimodal AI Hallucinations},
  author = {Jianhong Pang and Ruoxi Cheng and Ziyi Ye and Xingjun Ma and Zuxuan Wu and Xuanjing Huang and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2604.06714},
  year   = {2026}
}