中文

PiLaMIM:通过整合像素与潜在掩码图像建模实现更丰富的视觉表征

计算机视觉与模式识别 2025-01-07 v1

摘要

在掩码图像建模 (MIM) 中,主要存在两种方法:像素 MIM 和潜在 MIM,分别利用不同的重建目标,即原始像素和潜在表示。像素 MIM 倾向于捕捉颜色和纹理等低层次视觉细节,而潜在 MIM 则聚焦于物体的高层次语义。然而,这两种方法的不同优势可能导致在依赖特定层次视觉特征的任务中表现次优。为此,我们提出 PiLaMIM,一种统一框架,将像素 MIM 与潜在 MIM 结合以整合其互补的优势。该方法使用单一编码器配合两个不同的解码器:一个用于预测像素值,另一个用于预测潜在表示,确保捕捉到高层次和低层次视觉特征。我们进一步将 CLS token 融入重建过程,以聚合全局上下文,使模型能够捕获更丰富的语义信息。大量实验表明,PiLaMIM 在大多数情况下均优于 MAE、I-JEPA 和 BootMAE 等关键基线,证明其在提取更丰富视觉表征方面的有效性。

关键词

引用

@article{arxiv.2501.03005,
  title  = {PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling},
  author = {Junmyeong Lee and Eui Jun Hwang and Sukmin Cho and Jong C. Park},
  journal= {arXiv preprint arXiv:2501.03005},
  year   = {2025}
}