中文

RILS:语言语义空间中的掩码视觉重建

计算机视觉与模式识别 2023-03-01 v2

摘要

掩码图像建模(MIM)与自然语言监督均推动了可迁移视觉预训练的进展。本工作中,我们寻求两种范式的协同,并研究当 MIM 遇上自然语言监督时涌现的性质。为此,我们提出一种新颖的语言语义空间中的掩码视觉重建(RILS)预训练框架,其中由文本编码器编码的句子表示作为原型,将纯视觉信号转化为块-句子概率,作为具有语义意义的 MIM 重建目标。视觉模型因而可通过预测掩码词元的恰当语义来捕获带结构化信息的有用成分。更好的视觉表示又可经由图像-文本对齐目标反哺文本编码器,而这正是有效 MIM 目标转换的关键。大量实验结果证明,我们的方法不仅兼具先前 MIM 与 CLIP 之长,更因二者互益而在各类任务上取得进一步提升。RILS 在下游分类、检测与分割任务上展现出先进的迁移性,尤其在低样本情形下。代码将于 https://github.com/hustvl/RILS 提供。

关键词

引用

@article{arxiv.2301.06958,
  title  = {RILS: Masked Visual Reconstruction in Language Semantic Space},
  author = {Shusheng Yang and Yixiao Ge and Kun Yi and Dian Li and Ying Shan and Xiaohu Qie and Xinggang Wang},
  journal= {arXiv preprint arXiv:2301.06958},
  year   = {2023}
}