ESREAL:利用语义重构缓解视觉-语言模型中的幻觉
计算机视觉与模式识别
2024-10-07 v4 计算与语言
摘要
视觉-语言模型中的幻觉对其可靠性构成了重大挑战,尤其是在长描述生成方面。现有方法无法准确识别并缓解这些幻觉。为解决这一问题,我们提出了 ESREAL,一种新颖的无监督学习框架,旨在通过精确定位并惩罚产生幻觉的 token 来抑制幻觉的生成。首先,ESREAL 根据生成的描述构建重构图像,并将其对应区域与原始图像的区域进行对齐。这种语义重构有助于识别生成描述中 token 级幻觉的存在与类型。随后,ESREAL 根据幻觉类型评估对齐区域的语义相似度,从而计算 token 级幻觉分数。最后,ESREAL 采用近端策略优化算法,根据 token 级幻觉分数选择性地惩罚产生幻觉的 token。我们的框架在 CHAIR 指标上分别将 LLaVA、InstructBLIP 和 mPLUG-Owl2 的幻觉显著降低了 32.81%、27.08% 和 7.46%。这一改进完全仅利用源自图像本身的信号实现,无需任何图像-文本对。
引用
@article{arxiv.2403.16167,
title = {ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models},
author = {Minchan Kim and Minyeong Kim and Junik Bae and Suhwan Choi and Sungkyung Kim and Buru Chang},
journal= {arXiv preprint arXiv:2403.16167},
year = {2024}
}
备注
ECCV 2024