通过稀疏自编码器引导大视觉语言模型以缓解幻觉
计算机视觉与模式识别
2025-09-16 v2 人工智能
计算与语言
机器学习
摘要
大视觉语言模型(LVLMs)在多模态任务上取得了显著性能。然而,它们仍然受到幻觉的困扰,生成与视觉输入不一致的文本,这在现实应用中带来了重大风险。解决此问题的现有方法侧重于整合外部知识库、对齐训练或解码策略,所有这些都需要大量的计算成本和时间。近期工作尝试通过调整 LVLM 的内部表示来探索更高效的替代方案。尽管这些方法很有前景,但它们可能导致幻觉抑制不足,或产生过度干预从而对正常语义产生负面影响。在这项工作中,我们利用稀疏自编码器(SAEs)来识别与忠实性或幻觉密切相关的语义方向,提取更精确且解耦的幻觉相关表征。我们的分析表明,沿所识别的忠实方向进行干预可以缓解幻觉,而沿幻觉方向进行干预则会加剧幻觉。基于这些见解,我们提出了通过 SAE 潜在方向引导 LVLM(SSL),这是一种基于 SAE 衍生潜在方向的即插即用方法,用于缓解 LVLM 中的幻觉。大量实验表明,SSL 在缓解幻觉方面显著优于现有的解码方法,同时在不同模型架构间保持可迁移性,且额外的时间开销可忽略不计。代码可在 https://github.com/huazhenglin2003/SSL 获取。
引用
@article{arxiv.2505.16146,
title = {Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation},
author = {Zhenglin Hua and Jinghan He and Zijun Yao and Tianxu Han and Haiyun Guo and Yuheng Jia and Junfeng Fang},
journal= {arXiv preprint arXiv:2505.16146},
year = {2025}
}
备注
Accepted to Findings of EMNLP 2025