掩码图像建模表示中非语义噪声的抑制
计算机视觉与模式识别
2026-04-02 v1
摘要
掩码图像建模(MIM)已成为一种普遍的自监督视觉范式。在本工作中,我们表明MIM目标导致学到的表示保留非语义信息,最终损害推理性能。我们引入了一个模型无关的语义不变性评分,利用主成分分析(PCA)对真实和合成的非语义图像进行分析。基于该评分,我们提出了一种简单方法——语义正交伪影投影(SOAP),直接抑制图像块表示中的非语义信息,从而在各种基于MIM的模型中一致地提升零样本性能。SOAP是一种后置抑制方法,无需训练,可作为单个线性头附加到任何模型上。
引用
@article{arxiv.2604.00172,
title = {Suppressing Non-Semantic Noise in Masked Image Modeling Representations},
author = {Martine Hjelkrem-Tan and Marius Aasan and Rwiddhi Chakraborty and Gabriel Y. Arteaga and Changkyu Choi and Adín Ramírez Rivera},
journal= {arXiv preprint arXiv:2604.00172},
year = {2026}
}
备注
Published in CVPR 2026