缓解大型视觉语言模型中的多语言幻觉问题
计算机视觉与模式识别
2024-08-02 v1 人工智能
计算与语言
摘要
尽管大型视觉语言模型(LVLMs)在广泛的任务中展现出卓越的能力,但它们仍然存在幻觉问题,即在给定输入图像-查询对后生成合乎逻辑但错误的答案。这种幻觉现象在以非英语语言查询图像时更为严重,而现有方法仅针对英语场景缓解幻觉。在本文中,我们首次尝试缓解LVLMs中的这种重要的多语言幻觉。通过彻底的实验分析,我们发现LVLMs中的多语言幻觉是一种系统性问题,可能源于多语言能力的缺陷或不足的多模态能力。为此,我们提出了一种两种阶段的多语言幻觉消除(MHR)框架,用于LVLMs,旨在提高对高资源和低资源语言的幻觉抗性。不依赖复杂的人工多语言资源标注,我们充分利用LVLM的内在能力,提出一种新的跨语言对齐方法,该方法为每个图像-查询输入生成多个响应,然后识别每个语言的幻觉感知配对。最终将这些数据对用于直接的偏好优化,以引导LVLMs倾向于非幻觉响应。实验结果表明,我们的MHR显著减少了LVLMs的幻觉生成。值得注意的是,在我们扩展的多语言POPE基准测试中,本框架在13种不同语言上的准确率平均提高了19.0%。我们的代码和模型权重已在https://github.com/ssmisya/MHR提供。
引用
@article{arxiv.2408.00550,
title = {Mitigating Multilingual Hallucination in Large Vision-Language Models},
author = {Xiaoye Qu and Mingyang Song and Wei Wei and Jianfeng Dong and Yu Cheng},
journal= {arXiv preprint arXiv:2408.00550},
year = {2024}
}