动词幻象:揭示并评估多模态大语言模型中的动词概念幻觉
计算机视觉与模式识别
2025-12-23 v3
摘要
多模态大语言模型(MLLMs)近期受到广泛关注,并在光学字符识别(OCR)、视觉问答(VQA)、图像描述等任务中展现出卓越能力。然而,幻觉问题仍然持续存在。尽管已提出多种方法以减轻幻觉并取得了显著改进,但这些方法主要聚焦于缓解与物体/名词相关概念的幻觉。对于理解人类行为至关重要的动词概念,在很大程度上被忽视了。本论文中,据我们所知,我们首次从多个角度研究了MLLMs中的动词幻觉现象。我们的发现表明,大多数最先进的多模态大语言模型都遭受严重的动词幻觉。为了评估现有的物体概念幻觉缓解方法对动词幻觉的有效性,我们对这些方法进行了评估,发现它们并不能有效解决动词幻觉问题。为解决这一问题,我们提出了一种基于丰富动词知识的微调方法来缓解动词幻觉。实验结果表明,我们的方法显著减少了与动词相关的幻觉。
引用
@article{arxiv.2412.04939,
title = {Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models},
author = {Zehao Wang and Xinpeng Liu and Yudonglin Zhang and Xiaoqian Wu and Zhou Fang and Yifan Fang and Junfu Pu and Cewu Lu and Yong-Lu Li},
journal= {arXiv preprint arXiv:2412.04939},
year = {2025}
}
备注
Accepted by AAAI-26