中文

MV-MR:用于自监督学习与知识蒸馏的多视图多表示法

计算机视觉与模式识别 2024-06-04 v2

摘要

我们提出一种基于多视图与多表示(MV-MR)的自监督学习与知识蒸馏新方法。MV-MR基于最大化来自增强与非增强视图的可学习嵌入之间的依赖性,同时最大化来自增强视图的可学习嵌入与来自非增强视图的多个不可学习表示之间的依赖性。我们展示了所提方法可用于高效的自监督分类与模型无关的知识蒸馏。与其他自监督技术不同,我们的方法不使用任何对比学习、聚类或停止梯度。MV-MR是一个通用框架,允许通过使用图像多表示作为正则化项来对可学习嵌入施加约束。沿此思路,知识蒸馏被视为此类正则化的一个特例。MV-MR在非对比且无聚类的方法中,于STL10与ImageNet-1K数据集上取得了最先进(SOTA)性能。我们展示了使用所提基于CLIP ViT模型的知识蒸馏预训练的更低复杂度ResNet50模型,在STL10线性评估中达到了最先进性能。代码见:https://github.com/vkinakh/mv-mr

关键词

引用

@article{arxiv.2303.12130,
  title  = {MV-MR: multi-views and multi-representations for self-supervised learning and knowledge distillation},
  author = {Vitaliy Kinakh and Mariia Drozdova and Slava Voloshynovskiy},
  journal= {arXiv preprint arXiv:2303.12130},
  year   = {2024}
}