中文

对抗正交解缝:用于缓解大型视觉语言模型幻觉

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

大型视觉语言模型(LVLMs)在多模态理解方面取得了进步,但因幻觉(生成内容与视觉事实冲突)限制了其可靠性。现有缓解方法要么依赖成本高昂的外部干预(如指令调优和检索),要么使用内部机制,但仍受注意力权重和 entangled 隐藏表征的限制。我们提出对抗正交解缝(Adversarial Orthogonal Disentanglement, AOD),一种用于缓解LVLMs幻觉的潜在几何框架。AOD通过最小最大目标学习幻觉相关方向:分类器将幻觉信号浓缩到投影分量中,而对手通过梯度反转层从正交残差空间中去除它们。所学方向启用训练免费的双前向对比解码策略,在抑制幻觉的同时保留通用能力。在三个LVLMs上进行四个幻觉基准和四个实用基准的实验显示,AOD始终优于强基线。在POPE准确率上平均提升超6%,AMBER提升6%,在MMM等实用任务上保持强性能。进一步分析表明AOD在数据集间具有稳健迁移能力,表明其捕获的是通用幻觉相关偏差而非数据集特定制品。我们的源代码和数据集已提供。

关键词

引用

@article{arxiv.2605.25377,
  title  = {Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation},
  author = {Ruoxi Cheng and Haoxuan Ma and Zhengfei Hai and Yiyan Huang and Ranjie Duan and Tianle Zhang and Xu Yang and Ziyi Ye and Xingjun Ma},
  journal= {arXiv preprint arXiv:2605.25377},
  year   = {2026}
}