EFUF:缓解多模态大语言模型幻觉的高效细粒度遗忘框架
计算与语言
2024-09-24 v3 计算机视觉与模式识别
摘要
多模态大语言模型(MLLMs)在过去几年中引起了越来越多的关注,但它们仍可能生成包含相应图像中不存在物体的描述,这种现象被称为物体幻觉。为了消除幻觉,现有方法手动标注有无幻觉的配对回复,然后采用各种对齐算法来提升图像与文本之间的对齐能力。然而,这些方法不仅在微调阶段需要大量计算资源,还需要昂贵的人工标注来构建对齐算法所需的配对数据。为了解决这些问题,我们借鉴遗忘的思想,提出了一种高效的细粒度遗忘框架(EFUF),该框架无需配对数据即可消除幻觉。大量实验表明,我们的方法在保持生成质量的同时,能够持续减少幻觉,且仅产生适度的计算开销。我们的代码和数据集将公开发布。
引用
@article{arxiv.2402.09801,
title = {EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models},
author = {Shangyu Xing and Fei Zhao and Zhen Wu and Tuo An and Weihao Chen and Chunhui Li and Jianbing Zhang and Xinyu Dai},
journal= {arXiv preprint arXiv:2402.09801},
year = {2024}
}