中文

寻求像素级监督的视觉预训练

计算机视觉与模式识别 2025-12-18 v1

摘要

从根本上讲,像素是我们通过其视觉信息感知世界的来源。像素包含从低级属性到高级概念在内的各个层次的信息。自编码器代表了一种经典且长期存在的范式,用像素或其他原始输入学习表征。在本工作中,我们展示了基于自编码器的自监督学习至今仍具竞争力,可为下游任务产生强大的表征,同时保持简单、稳定和高效。我们的模型代号为"Pixio",是一种增强型掩码自编码器(MAE),具备更具挑战性的预训练任务和更强大的网络结构。该模型在20亿张网络爬取图像上进行训练,采用自我精选策略,最低限度的人工筛选。Pixio在野外广泛的下游任务上表现出竞争力,包括单目深度估计(如Depth Anything)、前馈3D重建(即MapAnything)、语义分割和机器人学习,超过或匹配在相似规模下训练的DINOv3。我们的结果表明,像素空间的自监督学习可以作为替代方案和补充,服务于潜在空间方法。

关键词

引用

@article{arxiv.2512.15715,
  title  = {In Pursuit of Pixel Supervision for Visual Pre-training},
  author = {Lihe Yang and Shang-Wen Li and Yang Li and Xinjie Lei and Dong Wang and Abdelrahman Mohamed and Hengshuang Zhao and Hu Xu},
  journal= {arXiv preprint arXiv:2512.15715},
  year   = {2025}
}

备注

Project page: https://github.com/facebookresearch/pixio