中文

什么相同?多模态模型在跨场景推理时会幻觉

机器学习 2025-11-07 v1 计算机视觉与模式识别

摘要

多模态语言模型表现出处理大量开放词汇表中对象的惊人能力。然而,最佳模型在就地场景推理中仍会出现幻觉,这揭示了它们在现实世界推理方面存在与现有感知基准(已饱和)之间的差距。为弥补这一差距,我们构建了一个以野生场景为基础的新基准,称为 Common-O。该基准包含超过 10.5k 个示例,仅使用从未出现在网络训练数据中的新图像,以避免污染,Common-O 超越了感知,灵感来自对人类认知测试的探索,通过询问“什么相同?”来探索跨场景的推理。我们评估了领先的多模态语言模型,包括专为执行链式思考推理而训练的模型。我们发现,尽管大多数模型能够可靠地感知单个图像中的对象,但即使是最佳模型在跨场景推理方面仍然非常具有挑战性,包括推理模型。尽管在许多聚焦于感知的排行榜上饱和,但最佳执行模型仅在 Common-O 上达到 35% — — 在更复杂场景的 Common-O Complex 上,最佳模型仅达到 1%。值得注意的是,我们发现当场景中存在相似对象时,模型更容易产生幻觉,这表明模型可能正在依赖训练期间看到的对象共现。我们评估的模型中发现,规模可以提供适度的改进,而专为多图像输入训练的模型显示出更大的改进,表明规模化的多图像训练可能提供了希望。我们将该基准公开,以激励研究人员解决跨场景推理时幻觉的挑战。

关键词

引用

@article{arxiv.2511.03768,
  title  = {What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes},
  author = {Candace Ross and Florian Bordes and Adina Williams and Polina Kirichenko and Mark Ibrahim},
  journal= {arXiv preprint arXiv:2511.03768},
  year   = {2025}
}

备注

10 pages, 6 figures. Accepted to NeurIPS Datasets & Benchmarks 2025