中文

无需训练即可看清:缓解多模态大语言模型遥感中的幻觉问题

计算机视觉与模式识别 2026-03-04 v1

摘要

多模态大语言模型(MLLM)在遥感视觉问答(RS-VQA)任务中存在显著幻觉现象,主要由大规模场景下的视觉定位失败或对细粒度小目标的误解所致。为系统性分析这些问题,我们引入了 RSHBench—a 一个基于协议的基准测试,用于细粒度诊断事实性和逻辑性幻觉。为缓解由视觉定位引起的事实性幻觉,我们进一步提出了相对注意力驱动的主动推理方法(RADAR),该方法利用 MLLM 中的内在注意力机制,在测试时引导渐进式局部定位和细粒度局部推理。广泛的实验表明,RADAR 在 various MLLMs 之间一致改善了 RS-VQA 性能,并显著降低了事实性和逻辑性幻觉。代码和数据将在 https://github.com/MiliLab/RADAR 公开。

关键词

引用

@article{arxiv.2603.02754,
  title  = {Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing},
  author = {Yi Liu and Jing Zhang and Di Wang and Xiaoyu Tian and Haonan Guo and Bo Du},
  journal= {arXiv preprint arXiv:2603.02754},
  year   = {2026}
}