Kestrel:面向 LVLM 幻觉缓解的自我完善 grounding 框架
计算机视觉与模式识别
2026-03-18 v1 人工智能
摘要
大型视觉语言模型(LVLMs)正在变得越来越强大,但在多模态任务中仍容易产生幻觉,这显著限制了其实际应用。由于为大型模型训练以避免幻觉变得昂贵,训练无监督的方法提供了经济且灵活的解决方案,但现有基于解码或工具使用的方法往往带来有限的提升和/或弱解释性。我们提出 Kestrel,一个面向 LVLM 幻觉缓解的训练无监督框架,将显式视觉 grounding agent 与 evidence-verified 自我完善机制相结合。具体而言,Kestrel 首先收集显式视觉证据并将工具输出转换为可重用且结构化的文本证据。其次,为了充分利用这些证据,Kestrel 通过一个 LVLM 评判器进行证据校验,然后基于已验证的证据迭代自我完善答案,以减少过度纠正的风险。大量实验表明,Kestrel 在幻觉基准测试中优于强大 baselines,例如在 Qwen3-VL 上平均提升 3.31% 的 POPE 得分和 28.34% 的 MME-Hallucination 得分,同时为幻觉诊断和分析提供透明的验证痕迹——例如,集成的自我完善模块和 grounding agent 在 POPE 上平均提升 2.0% 的得分。
引用
@article{arxiv.2603.16664,
title = {Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation},
author = {Jiawei Mao and Hardy Chen and Haoqin Tu and Yuhan Wang and Letian Zhang and Zeyu Zheng and Huaxiu Yao and Zirui Wang and Cihang Xie and Yuyin Zhou},
journal= {arXiv preprint arXiv:2603.16664},
year = {2026}
}
备注
16 pages, 11 figures, 5 tables