OPERA:通过过度信任惩罚与回溯重分配缓解多模态大语言模型中的幻觉
计算机视觉与模式识别
2024-03-13 v3
摘要
幻觉作为多模态大语言模型(MLLMs)普遍存在的挑战,严重阻碍了它们在需要精确判断的实际场景中的使用。现有方法通过特定设计数据的训练或借助外部知识推理来缓解该问题,不可避免地带来了额外成本。本文提出OPERA,一种基于过度信任惩罚(Over-trust Penalty)与回溯重分配(Retrospection-Allocation)策略的新型MLLM解码方法,可在无需额外数据、知识或训练的情况下近乎零成本地缓解幻觉问题。我们的方法始于一个有趣观察:大多数幻觉与自注意力矩阵中展现的知识聚合模式密切相关,即MLLMs倾向于通过关注少数总结性token而非所有先前token来生成新token。这种局部的过度信任倾向导致忽略图像token,并以幻觉描述图像内容。基于该观察,OPERA在束搜索解码过程中对模型logits引入惩罚项以缓解过度信任问题,同时采用回滚策略回溯先前生成token中总结性token的存在,并在必要时重新分配token选择。大量实验表明,OPERA在不同MLLM与指标上均展现出显著的幻觉缓解性能,证明了其有效性与通用性。我们的代码见:https://github.com/shikiw/OPERA。
引用
@article{arxiv.2311.17911,
title = {OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation},
author = {Qidong Huang and Xiaoyi Dong and Pan Zhang and Bin Wang and Conghui He and Jiaqi Wang and Dahua Lin and Weiming Zhang and Nenghai Yu},
journal= {arXiv preprint arXiv:2311.17911},
year = {2024}
}
备注
CVPR 2024, code is available at https://github.com/shikiw/OPERA