中文

SAVE:稀疏自编码器驱动的视觉信息增强,用于缓解对象幻觉

计算机视觉与模式识别 2025-12-12 v2 人工智能

摘要

虽然多模态大语言模型 (MLLM) 已取得显著进展,但仍然容易受到语言先验和视觉信息丢失导致的对象幻觉影响。为此,我们提出了 SAVE (Sparse Autoencoder-Driven Visual Information Enhancement),一个通过沿着稀疏自编码器 (SAE) 潜在特征引导模型,以减轻幻觉的框架。一种二元对象存在问答探针识别最能指示模型视觉信息处理的 SAE 特征,称为视觉理解特征。沿着这些被识别的特征引导模型,可强化基于真实的视觉理解,从而有效减少幻觉。凭借其简单设计,SAVE 在标准基准测试中超越了最先进的无训练方法,实现 CHAIR_S 提升 10%,在 POPE 和 MMHal-Bench 上持续获得提升。广泛的评估跨越多个模型和层次,确认了该方法的鲁棒性和通用性。进一步分析揭示,沿着视觉理解特征的引导可抑制不确定对象标记的生成,并增加对图像标记的注意力,从而缓解了幻觉。代码已发布于 https://github.com/wiarae/SAVE。

关键词

引用

@article{arxiv.2512.07730,
  title  = {SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination},
  author = {Sangha Park and Seungryong Yoo and Jisoo Mok and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2512.07730},
  year   = {2025}
}

备注

WACV 2026