指令镜头得分:你的指令为多模态大语言模型构建强大的对象幻觉检测器
机器学习
2026-05-13 v1
摘要
多模态大语言模型(MLLM)取得了显著进展,但对象幻觉仍是可靠部署的关键挑战。本文对指令标记嵌入进行深入分析,揭示它们在隐式编码视觉信息的同时,有效过滤由误导性视觉嵌入引入的错误信息。基于此洞察,我们提出了指令镜头得分(InsLen),其结合了校准局部得分与上下文一致性得分,后者衡量对象标记的上下文一致性。该方法作为一种无需辅助模型或额外训练的即插即用对象幻觉检测器。广泛的实验在多个基准和多样化MLLM架构上表明,InsLen consistently 超越现有幻觉检测方法,凸显其有效性和鲁棒性。代码已公开于 https://github.com/Fraserlairh/Instruction-Lens-Score。
引用
@article{arxiv.2605.12258,
title = {Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models},
author = {Runhe Lai and Xinhua Lu and Yanqi Wu and Jinlun Ye and Weijiang Yu and Ruixuan Wang},
journal= {arXiv preprint arXiv:2605.12258},
year = {2026}
}
备注
Accepted by ICML-2026