透过第二层看清:增强注意力头以缓解LVLMs中的幻觉
计算机视觉与模式识别
2024-11-18 v1 人工智能
摘要
多模态大语言模型(MLLMs)中的幻觉问题仍是普遍存在的难题。尽管图像标记占据MLLMs输入序列的大多数,但探究图像标记与幻觉关系的研究有限。本文分析了模型各层各头中图像标记注意力分数的分布,揭示了一个引人入胜且普遍的现象:大多数幻觉与图像标记自注意力矩阵中注意力汇聚的模式密切相关,浅层表现为稠密的注意力汇聚,深层则表现为稀疏的注意力汇聚。进一步分析不同层的注意力头发现,图像部分具有高密度注意力汇聚的头在缓解幻觉方面起积极作用。本文提出一种名为\textcolor{red}{\textbf{E}}nhancing \textcolor{red}{\textbf{A}}ttention \textcolor{red}{\textbf{H}}eads (EAH)的免训练方法,旨在增强浅层图像标记注意力汇聚的收敛。EAH识别出在浅层表现出视觉汇聚的注意力头并提取其注意力矩阵,随后将该注意力图广播给该层其他头,从而强化该层更多地关注图像本身。大量实验表明,EAH在不同MLLMs和指标上均展现出显著的幻觉缓解性能,证明了其有效性和泛化性。
引用
@article{arxiv.2411.09968,
title = {Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs},
author = {Xiaofeng Zhang and Yihao Quan and Chaochen Gu and Chen Shen and Xiaosong Yuan and Shaotian Yan and Hao Cheng and Kaijie Wu and Jieping Ye},
journal= {arXiv preprint arXiv:2411.09968},
year = {2024}
}