从视觉基础模型进行知识迁移以高效训练小型特定任务模型
计算机视觉与模式识别
2024-07-03 v3 机器学习
摘要
在大规模数据集上预训练的视觉基础模型(VFMs)在各种下游任务中表现出令人印象深刻的性能,尤其在目标标注数据有限时。然而,由于其高推理计算成本,这些模型无法部署于许多现实应用。受此驱动,我们提出如下重要问题:“如何利用大型 VFM 的知识,在有限标注训练数据下为新目标任务训练小型特定任务模型?”,并提出了一种简单的面向任务的知识迁移方法作为该问题的高效解决方案。我们在五个目标任务上的实验结果表明,所提方法分别优于任务无关 VFM 蒸馏、网络规模 CLIP 预训练、有监督 ImageNet 预训练及自监督 DINO 预训练,幅度最高达 11.6%、22.1%、13.7% 与 29.8%。此外,与任务无关 VFM 蒸馏、ImageNet 预训练及 DINO 预训练相比,所提方法在预训练计算成本上分别实现了最高 9 倍、4 倍与 15 倍的降低,同时性能更优。我们还表明,用于迁移知识的数据集对最终目标任务性能有显著影响,并引入了检索增强的知识迁移策略,利用网络规模图像检索来筛选有效的迁移集。
引用
@article{arxiv.2311.18237,
title = {Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models},
author = {Raviteja Vemulapalli and Hadi Pouransari and Fartash Faghri and Sachin Mehta and Mehrdad Farajtabar and Mohammad Rastegari and Oncel Tuzel},
journal= {arXiv preprint arXiv:2311.18237},
year = {2024}
}
备注
International Conference on Machine Learning, 2024