中文

NoiseBoost: 通过噪声扰动缓解多模态大语言模型的幻觉

计算机视觉与模式识别 2024-06-03 v2 人工智能

摘要

多模态大语言模型(MLLMs)在理解视觉信息方面提供了强大的机制,但容易产生幻觉,尤其是在生成冗长详细的图像描述时。我们的分析表明,幻觉源于大语言模型固有的总结机制,导致过度依赖语言标记而忽略视觉信息。在本文中,我们提出NoiseBoost,一种通过集成噪声特征扰动来缓解MLLMs幻觉的广泛适用且简单的方法。噪声扰动作为正则化器,促进视觉和语言标记之间注意力权重的平衡分布。尽管简单,NoiseBoost在常见训练策略(包括监督微调和强化学习)中持续提升MLLMs的性能。此外,NoiseBoost首次实现了MLLMs的半监督学习,释放了未标记数据的潜力。大量实验表明,NoiseBoost通过人工评估将密集描述准确率提高了8.1%,并通过挖掘未标记数据在50%的数据量下取得了可比结果。代码和模型可在 https://kaiwu5.github.io/noiseboost 获取。

关键词

引用

@article{arxiv.2405.20081,
  title  = {NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models},
  author = {Kai Wu and Boyuan Jiang and Zhengkai Jiang and Qingdong He and Donghao Luo and Shengzhi Wang and Qingwen Liu and Chengjie Wang},
  journal= {arXiv preprint arXiv:2405.20081},
  year   = {2024}
}

备注

14 pages, 5 figures with supplementary material