利用多视角图像和负面指令缓解对象属性幻觉
计算机视觉与模式识别
2025-01-20 v1 人工智能
摘要
当前流行的大型视觉语言模型 (LVLMs) 正在因对象属性幻觉 (HoOA) 问题而受到影响,导致对输入图像中细粒度属性的判断不准确。本文利用从单张图像生成3D表示的显著进展,提出了一种新颖的方法来缓解LVLMs中的HoOA问题。该方法利用从生成的3D表示中采样的多视角图像作为视觉提示符,从其他视角提供更多视觉信息。此外,我们发现,多视角图像的输入顺序显著影响LVLMs的性能。因此,我们设计了多视角图像增强型视觉语言模型 (MIAVLM),其中包含一个多视角属性感知器 (MAP) 子模块,能够同时消除输入图像顺序的影响,并将多视角图像的视觉信息与大语言模型 (LLM) 对齐。我们还设计并运用了负面指令,以缓解LVLMs对“是”响应的偏见。全面实验表明,我们的方法有效性卓著。
引用
@article{arxiv.2501.10011,
title = {Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions},
author = {Zhijie Tan and Yuzhi Li and Shengwei Meng and Xiang Yuan and Weiping Li and Tong Mo and Bingce Wang and Xu Chu},
journal= {arXiv preprint arXiv:2501.10011},
year = {2025}
}
备注
2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)