FINER: MLLMs 在细粒度负面查询下出现幻觉
计算机视觉与模式识别
2026-03-19 v1 人工智能
摘要
多模态大语言模型(MLLM)在面对细粒度查询时容易产生幻觉, 而现有基准主要聚焦于粗糙的图像相关问题。我们引入FIne-grained NEgative queRies(FINER), 并构建两个基准: FINER-CompreCap 与FINER-DOCCI。使用FINER, 我们分析了在四种情景下的幻觉现象: 多目标、多属性、多关系和"what"问题。在我们的基准中发现, 当细粒度不匹配与图像中真实存在的元素共现时, MLLM会产生幻觉。为解决此问题, 我们提出FINER-Tuning, 采用Direct Preference Optimization(DPO)在FINER 启发的数据上进行微调。对四个前沿MLLM进行FINER-Tuning微调, 可在我们的基准上实现最高24.2%的幻觉降低(以InternVL3.5-14B为例), 同时在八个现有幻觉测试套件上提升性能, 并在六个基准上提升通用多模态能力。代码、基准和模型均已在\href{https://explainableml.github.io/finer-project/}{https://explainableml.github.io/finer-project/}提供。
引用
@article{arxiv.2603.17662,
title = {FINER: MLLMs Hallucinate under Fine-grained Negative Queries},
author = {Rui Xiao and Sanghwan Kim and Yongqin Xian and Zeynep Akata and Stephan Alaniz},
journal= {arXiv preprint arXiv:2603.17662},
year = {2026}
}
备注
CVPR 2026