中文

利用多视角图像和负面指令缓解对象属性幻觉

计算机视觉与模式识别 2025-01-20 v1 人工智能

摘要

当前流行的大型视觉语言模型 (LVLMs) 正在因对象属性幻觉 (HoOA) 问题而受到影响,导致对输入图像中细粒度属性的判断不准确。本文利用从单张图像生成3D表示的显著进展,提出了一种新颖的方法来缓解LVLMs中的HoOA问题。该方法利用从生成的3D表示中采样的多视角图像作为视觉提示符,从其他视角提供更多视觉信息。此外,我们发现,多视角图像的输入顺序显著影响LVLMs的性能。因此,我们设计了多视角图像增强型视觉语言模型 (MIAVLM),其中包含一个多视角属性感知器 (MAP) 子模块,能够同时消除输入图像顺序的影响,并将多视角图像的视觉信息与大语言模型 (LLM) 对齐。我们还设计并运用了负面指令,以缓解LVLMs对“是”响应的偏见。全面实验表明,我们的方法有效性卓著。

关键词

引用

@article{arxiv.2501.10011,
  title  = {Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions},
  author = {Zhijie Tan and Yuzhi Li and Shengwei Meng and Xiang Yuan and Weiping Li and Tong Mo and Bingce Wang and Xu Chu},
  journal= {arXiv preprint arXiv:2501.10011},
  year   = {2025}
}

备注

2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)