中文

R-MAE:区域遇见掩码自编码器

计算机视觉与模式识别 2024-01-08 v2

摘要

在本工作中,我们将区域探索为用于自监督图像表示学习的潜在视觉词类比。受掩码自编码(MAE)这一生成式预训练基线的启发,我们提出掩码区域自编码,从像素组或区域中学习。具体而言,我们设计了一种架构,能有效解决图像与区域之间的一对多映射问题,同时在高质量区域下尤为高效。当与 MAE 集成时,我们的方法(R-MAE)在各种预训练数据集以及下游检测与分割基准上展现出一致的提升,且计算开销可忽略。除定量评估外,我们的分析表明,通过掩码区域自编码预训练的模型释放了交互式分割的潜力。代码见 https://github.com/facebookresearch/r-mae。

关键词

引用

@article{arxiv.2306.05411,
  title  = {R-MAE: Regions Meet Masked Autoencoders},
  author = {Duy-Kien Nguyen and Vaibhav Aggarwal and Yanghao Li and Martin R. Oswald and Alexander Kirillov and Cees G. M. Snoek and Xinlei Chen},
  journal= {arXiv preprint arXiv:2306.05411},
  year   = {2024}
}