KVSmooth:通过键值平滑缓解多模态大语言模型中的幻觉
计算机视觉与模式识别
2026-03-12 v2
摘要
尽管多模态大语言模型(MLLMs)在 diverse 任务上取得了显著进展,但幻觉——即生成与视觉输入不一致的物体、属性或关系——仍是其可靠部署的主要障碍。不同于纯语言模型,MLLMs 必须将其生成过程 grounding 在视觉输入上。然而,现有模型在解码过程中常常出现语义漂移,导致输出随序列长度增加而偏离视觉事实。为解决此问题,我们提出 KVSmooth,一种无需训练、即插即用的方法,通过对隐藏状态执行基于注意力熵的自适应平滑来缓解幻觉。具体而言,KVSmooth 对 KV 缓存中的键和值应用指数移动平均(EMA),同时通过动态量化每个 token 在注意力分布中的 sink degree 来自适应调整平滑强度。不同于计算昂贵的再训练或对比解码方法,KVSmooth 在推理期间高效运行,无需额外训练或模型修改。广泛的实验表明,KVSmooth 显著减少了幻觉( 从 ),同时提升了整体性能( 分数从 ),在精度和召回率方面实现同步提升。相比,先前方法往往在一个方面提升而牺牲另一个方面,验证了该方法的有效性和通用性。
引用
@article{arxiv.2602.04268,
title = {KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing},
author = {Siyu Jiang and Feiyang Chen and Xiaojin Zhang and Kun He},
journal= {arXiv preprint arXiv:2602.04268},
year = {2026}
}
备注
Accepted by CVPR 2026