中文

ClipTTT:CLIP 引导的测试时训练帮助 LVLM 更好地理解视觉信息

计算机视觉与模式识别 2026-03-30 v1

摘要

大型视觉语言模型(LVLM)容易产生幻觉,尤其是在测试时视觉输入受到损坏的情况下。我们证明此类损坏充当额外的分布偏移,显著放大了真实应用中的幻觉率。为解决这一问题,我们提出 CLIP 引导的测试时训练(ClipTTT),一种利用单个测试样本在退化条件下自适应 LVLM 的方法。具体而言,我们利用预训练 CLIP 模型的图像-文本对齐能力作为稳定的引导信号,以识别可靠的自我监督目标,从而实现快速自适应而不改变基础 LVLM。在标准幻觉基准测试上,针对 15 种常见损坏进行的大量实验表明,ClipTTT 有效缓解了幻觉并在视觉损坏下提升了描述的忠实性。

关键词

引用

@article{arxiv.2603.26486,
  title  = {ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better},
  author = {Mriganka Nath and Anurag Das and Jiahao Xie and Bernt Schiele},
  journal= {arXiv preprint arXiv:2603.26486},
  year   = {2026}
}

备注

30 pages, 12 figures