Nullu:通过HalluSpace投影缓解大型视觉语言模型中的对象幻觉
计算机视觉与模式识别
2025-03-18 v3
摘要
近期研究表明,大型视觉语言模型(LVLMs)常受对象幻觉(OH)问题困扰。为缓解此问题,我们引入了一种基于不安全子空间(本文称为HalluSpace)编辑模型权重的有效方法。以伴随视觉内容的真实和幻觉文本提示作为输入,通过提取幻觉嵌入特征并移除LVLMs中的真实表示,可以识别HalluSpace。通过正交化模型权重,输入特征将被投影到HalluSpace的零空间中以减少OH,据此我们将方法命名为Nullu。我们揭示HalluSpace通常包含用于构建LVLMs的大型语言模型(LLMs)中的先验信息,先前研究已表明这些信息是OH的重要原因。因此,零空间投影抑制了LLMs的先验,以过滤掉幻觉特征,从而产生上下文准确的输出。实验表明,我们的方法能在不同LVLM家族中有效缓解OH,且无需额外推理成本,在通用LVLM基准测试中也表现出强劲性能。代码已发布在https://github.com/Ziwei-Zheng/Nullu。
引用
@article{arxiv.2412.13817,
title = {Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection},
author = {Le Yang and Ziwei Zheng and Boxu Chen and Zhengyu Zhao and Chenhao Lin and Chao Shen},
journal= {arXiv preprint arXiv:2412.13817},
year = {2025}
}
备注
CVPR 2025