中文

通过数据增强短语级对齐缓解多模态大语言模型中的对象幻觉

计算机视觉与模式识别 2025-03-03 v3

摘要

尽管多模态大语言模型(MLLMs)取得了显著进展,但常会生成事实不准确的信息,称为幻觉。本文针对MLLMs中的对象幻觉问题进行了解决,即生成关于输入图像中不存在的对象的信息。我们引入数据增强短语级对齐(DPA),这是一种新型损失函数,可应用于指令调优的即插即用MLLMs,以缓解幻觉,同时保留其通用的视觉语言能力。为了使用DPA微调MLLMs,我们首先通过在正确响应的短语层面有选择地修改正确响应的事实信息,从而生成一组“幻觉”和“正确”响应对。随后使用DPA损失训练MLLMs,以减少幻觉短语的可能性。我们的全面评估表明,DPA在缓解幻觉方面有效,同时保留了MLLMs在一般任务上的即插即用性能。例如,使用DPA微调的MLLMs(我们称之为幻觉削弱语言和视觉助手,HALVA)在幻觉视觉问答任务中F1分数提升最高可达13.4%,在图像描述任务中幻觉率降低最高可达4.2%。

关键词

引用

@article{arxiv.2405.18654,
  title  = {Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment},
  author = {Pritam Sarkar and Sayna Ebrahimi and Ali Etemad and Ahmad Beirami and Sercan Ö. Arık and Tomas Pfister},
  journal= {arXiv preprint arXiv:2405.18654},
  year   = {2025}
}

备注

Published in ICLR 2025