中文

从语义到像素:层次化视觉理解的粗到细掩码自编码器

计算机视觉与模式识别 2026-03-11 v1 机器学习

摘要

自监督视觉预训练方法面临内在张力:对比学习(CL)捕获全局语义但丢失细粒细节,而掩码图像建模(MIM)保留局部纹理但因语义无关的随机掩码导致注意力漂移。我们提出C2FMAE(Coarse-to-Fine MAE),一种粗到细掩码自编码器,通过在三个数据粒度上显式学习层次化视觉表征来解决这一张力:语义掩码(场景级)、实例掩码(对象级)和RGB图像(像素级)。两个协同创新 enforces strict 的自上而下学习原则。首先,级联解码器依次从场景语义到对象实例再到像素细节进行重构,建立显式的跨粒度依赖关系,这些依赖关系无法被平行解码器捕获。其次,渐进式掩码 curriculum 动态地将训练焦点从语义引导式转向实例引导式,最终转向随机掩码,创建从全局上下文到局部特征的结构化学习路径。为支持此框架,我们构建了一个包含 128 万张 ImageNet-1K 图像的大规模多粒度数据集,配有高质量伪标签。广泛实验表明,C2FMAE 在图像分类、目标检测和语义分割上均实现显著性能提升,验证了该层次化设计在学习更稳健和更通用表征方面的有效性。

关键词

引用

@article{arxiv.2603.09955,
  title  = {From Semantics to Pixels: Coarse-to-Fine Masked Autoencoders for Hierarchical Visual Understanding},
  author = {Wenzhao Xiang and Yue Wu and Hongyang Yu and Feng Gao and Fan Yang and Xilin Chen},
  journal= {arXiv preprint arXiv:2603.09955},
  year   = {2026}
}