中文

理解与评估 3D 视觉语言模型中的幻觉现象

计算机视觉与模式识别 2025-02-25 v1

摘要

最近,融合点云编码器与大模型的 3D-LLM 提出用于解决具身智能和场景理解中的复杂任务。除了在 3D 任务上显示出前景之外,我们发现它们受到幻觉的显著影响。例如,它们可能生成场景中不存在的物体,或产生物体之间的错误关系。为调查此问题,本工作提出了对 3D-LLM 幻觉的首个系统性研究。我们首先快速评估了几个代表性 3D-LLM 中的幻觉现象,发现它们都受到显著幻觉影响。随后我们定义了 3D 场景中的幻觉,并通过对数据集的详细分析揭示了这些幻觉的根本原因。我们发现三个主要原因:(1) 数据集中物体频率分布不均;(2) 物体之间存在强相关性;(3) 物体属性的多样性有限。此外,我们提出了新的幻觉评估指标,包括随机点云配对与相反问题评估,用于评估模型是否基于视觉信息生成响应,并与文本含义保持一致。

关键词

引用

@article{arxiv.2502.15888,
  title  = {Understanding and Evaluating Hallucinations in 3D Visual Language Models},
  author = {Ruiying Peng and Kaiyuan Li and Weichen Zhang and Chen Gao and Xinlei Chen and Yong Li},
  journal= {arXiv preprint arXiv:2502.15888},
  year   = {2025}
}