面向视觉预训练的对象级自蒸馏
计算机视觉与模式识别
2025-06-09 v1 机器学习
摘要
当前领先的视觉预训练方法依赖于从以目标为中心的数据集(如ImageNet)进行图像级自蒸馏,隐含假设每个图像仅包含单个对象。但这一假设并不总是成立:许多ImageNet图像已经包含多个对象。此外,这限制了其可扩展性到更贴近真实世界复杂性的场景型数据集。为此,本文引入对象级自蒸馏(ODIS)一种预训练方法,将自蒸馏粒度从整个图像转向单个对象。通过对象感知裁剪和掩码注意力机制,ODIS隔离对象特定区域,引导transformer聚焦于语义上有意义的内容,将噪声的场景级任务转化为更简单的对象级子任务。我们表明,该方法在图像和 patch 级别均提升了视觉表征。使用掩码进行推理,该方法在ViT-Large上实现了惊人的82.6% k-NN 准确率。
关键词
引用
@article{arxiv.2506.05409,
title = {Object-level Self-Distillation for Vision Pretraining},
author = {Çağlar Hızlı and Çağatay Yıldız and Pekka Marttinen},
journal= {arXiv preprint arXiv:2506.05409},
year = {2025}
}