通过细化文本嵌入来缓解大型视觉语言模型中的幻觉问题
计算机视觉与模式识别
2025-11-10 v1 计算与语言
摘要
在本工作中,我们识别出当下LVLm架构对语言模态的内在偏差,这主要源于将视觉嵌入简单追加到输入文本序列所致的常规做法。为此,我们提出一种简单而有效的方法,通过整合平均池化的视觉特征来细化文本嵌入。我们的方法在 established benchmarks 上显著改善了视觉定位并大幅降低了幻觉现象。虽然平均池化提供了一种直观、稳健且高效地将视觉信息纳入的方法的途径,但我们认为更复杂的融合方法可能会进一步提升视觉定位和跨模态对齐。鉴于本工作的主要焦点是凸显模态不平衡及其对幻觉的影响——以及表明用视觉信息细化文本嵌入可缓解此问题——我们将探索更先进的融合策略留给未来的工作。
引用
@article{arxiv.2511.05017,
title = {Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings},
author = {Aakriti Agrawal and Gouthaman KV and Rohith Aralikatti and Gauri Jagatap and Jiaxin Yuan and Vijay Kamarshi and Andrea Fanelli and Furong Huang},
journal= {arXiv preprint arXiv:2511.05017},
year = {2025}
}