寻求像素级监督的视觉预训练
计算机视觉与模式识别
2025-12-18 v1
摘要
从根本上讲,像素是我们通过其视觉信息感知世界的来源。像素包含从低级属性到高级概念在内的各个层次的信息。自编码器代表了一种经典且长期存在的范式,用像素或其他原始输入学习表征。在本工作中,我们展示了基于自编码器的自监督学习至今仍具竞争力,可为下游任务产生强大的表征,同时保持简单、稳定和高效。我们的模型代号为"Pixio",是一种增强型掩码自编码器(MAE),具备更具挑战性的预训练任务和更强大的网络结构。该模型在20亿张网络爬取图像上进行训练,采用自我精选策略,最低限度的人工筛选。Pixio在野外广泛的下游任务上表现出竞争力,包括单目深度估计(如Depth Anything)、前馈3D重建(即MapAnything)、语义分割和机器人学习,超过或匹配在相似规模下训练的DINOv3。我们的结果表明,像素空间的自监督学习可以作为替代方案和补充,服务于潜在空间方法。
引用
@article{arxiv.2512.15715,
title = {In Pursuit of Pixel Supervision for Visual Pre-training},
author = {Lihe Yang and Shang-Wen Li and Yang Li and Xinjie Lei and Dong Wang and Abdelrahman Mohamed and Hengshuang Zhao and Hu Xu},
journal= {arXiv preprint arXiv:2512.15715},
year = {2025}
}
备注
Project page: https://github.com/facebookresearch/pixio