面向自监督细粒度视觉分类的跨层多实例蒸馏
计算机视觉与模式识别
2025-06-25 v3
摘要
高质量标注细粒度视觉类别需要大量的专业知识,既费力又耗时。另一种方法是,通过自监督学习从海量未标记图像(例如物种、品牌)中学习细粒度视觉表示成为一种可行的解决方案。然而,最近的研究发现,现有的自监督学习方法在表示细粒度类别方面能力较差。瓶颈在于,前置文本表示是从每个图像块的嵌入构建的,而细粒度类别仅由图像中的几个关键图像块决定。在本文中,我们提出了一个跨层多实例蒸馏(CMD)框架来应对这一挑战。我们的核心思想是通过多实例学习来考虑每个图像块在确定细粒度前置文本表示中的重要性。为了全面学习信息丰富的图像块与细粒度语义之间的关系,多实例知识蒸馏在教师网络和学生网络之间的区域/图像裁剪对,以及教师/学生网络内部的区域-图像裁剪上同时进行,我们将其分别称为层内多实例蒸馏和层间多实例蒸馏。在CUB-200-2011、Stanford Cars和FGVC Aircraft数据集上的大量实验表明,所提出的方法在top-1准确率和Rank-1检索指标上,比同期方法高出多达10.14%,比现有最先进的自监督学习方法高出多达19.78%。
引用
@article{arxiv.2401.08860,
title = {Cross-Level Multi-Instance Distillation for Self-Supervised Fine-Grained Visual Categorization},
author = {Qi Bi and Wei Ji and Jingjun Yi and Haolan Zhan and Gui-Song Xia},
journal= {arXiv preprint arXiv:2401.08860},
year = {2025}
}
备注
Accepted by IEEE Transactions on Image Processing (TIP)