中文

掩码图像建模表示中非语义噪声的抑制

计算机视觉与模式识别 2026-04-02 v1

摘要

掩码图像建模(MIM)已成为一种普遍的自监督视觉范式。在本工作中,我们表明MIM目标导致学到的表示保留非语义信息,最终损害推理性能。我们引入了一个模型无关的语义不变性评分,利用主成分分析(PCA)对真实和合成的非语义图像进行分析。基于该评分,我们提出了一种简单方法——语义正交伪影投影(SOAP),直接抑制图像块表示中的非语义信息,从而在各种基于MIM的模型中一致地提升零样本性能。SOAP是一种后置抑制方法,无需训练,可作为单个线性头附加到任何模型上。

关键词

引用

@article{arxiv.2604.00172,
  title  = {Suppressing Non-Semantic Noise in Masked Image Modeling Representations},
  author = {Martine Hjelkrem-Tan and Marius Aasan and Rwiddhi Chakraborty and Gabriel Y. Arteaga and Changkyu Choi and Adín Ramírez Rivera},
  journal= {arXiv preprint arXiv:2604.00172},
  year   = {2026}
}

备注

Published in CVPR 2026