HulluEdit:面向大视觉语言模型的单次证据一致子空间编辑以缓解幻觉
计算机视觉与模式识别
2026-02-27 v1
摘要
大型视觉语言模型(LVLMs)中的对象幻觉显著阻碍了其可靠部署。现有方法在效率与准确性之间难以平衡:它们需要昂贵的参考模型和多次前向传播,或应用静态编辑而风险压制真实视觉证据。为此,我们引入 HulluEdit,一个单次、无参考的干预框架。我们的核心创新是正交子空间编辑:我们将模型的隐藏状态分解为正交子空间——视觉证据、冲突先验和残余不确定性——实现对幻觉模式的选择性抑制,而不干扰视觉 grounding。这种方法数学上保证了对先验子空间所施加的编辑完全不影响视觉分量。大量实验表明,HulluEdit 在包括 POPE 和 CHAIR 在内的基准测试上实现了最先进的幻觉降低,同时在 MME 上保持通用能力并实现高效推理。我们的方法持续优于对抗解码和静态子空间编辑基线,为更可信的 LVLMs 提供了新路径。
引用
@article{arxiv.2602.22727,
title = {HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models},
author = {Yangguang Lin and Quan Fang and Yufei Li and Jiachen Sun and Junyu Gao and Jitao Sang},
journal= {arXiv preprint arXiv:2602.22727},
year = {2026}
}
备注
accepted at CVPR 2026