PerturboLLaVA:通过微扰视觉训练减少多模态幻觉
计算机视觉与模式识别
2025-03-11 v1 人工智能
摘要
本文旨在解决多模态大语言模型(MLLMs)中的幻觉挑战,特别是针对密集图像描述任务。为应对这一挑战,我们发现当前缺乏在概念层面精细衡量描述质量的指标。我们在此引入 HalFscore,这是一种建立在语言图基础上的新颖指标,旨在细粒度层面评估密集描述的准确性和完整性。此外,我们将幻觉的根本原因归结为模型对其语言先验的过度依赖。为了解决这个问题,我们提出了 PerturboLLaVA,它通过在训练过程中引入对抗性微扰文本,减少模型对语言先验的依赖。该方法增强了模型对视觉输入的关注,有效减少了幻觉,并生成了准确、基于图像的描述,且不产生额外的计算开销。PerturboLLaVA 显著提高了生成描述的保真度,在处理多模态幻觉方面优于现有方法,并在通用多模态基准测试中取得了更好的性能。
引用
@article{arxiv.2503.06486,
title = {PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training},
author = {Cong Chen and Mingyu Liu and Chenchen Jing and Yizhou Zhou and Fengyun Rao and Hao Chen and Bo Zhang and Chunhua Shen},
journal= {arXiv preprint arXiv:2503.06486},
year = {2025}
}