中文

明智选择与深度学习:基于 CLIP 的选择性跨模态蒸馏用于域泛化

计算机视觉与模式识别 2024-04-24 v3

摘要

域泛化(DG)是一个关键的研究领域,旨在跨多个域训练模型并在未见域上进行测试。本文提出一种新方法,即用于域泛化的选择性跨模态蒸馏(SCMD)。SCMD 利用大型视觉-语言模型(特别是 CLIP)的能力来训练更高效的模型,确保其在未见域上获得鲁棒的泛化能力。我们的主要贡献是一个独特的选择框架,该框架经过策略性设计以识别难以学习的样本用于蒸馏。同时,我们引入了一种新颖的跨模态模块,将学生模型的投影特征与 CLIP 的文本嵌入无缝结合,确保相似度分布的对齐。我们在多个基准上评估了 SCMD 的性能,其使 ResNet50 取得了最先进的性能,超越了现有的域泛化方法。此外,我们对选择策略进行了理论分析,深入揭示了其在 DG 领域的有效性与潜力。

关键词

引用

@article{arxiv.2311.15145,
  title  = {Choosing Wisely and Learning Deeply: Selective Cross-Modality Distillation via CLIP for Domain Generalization},
  author = {Jixuan Leng and Yijiang Li and Haohan Wang},
  journal= {arXiv preprint arXiv:2311.15145},
  year   = {2024}
}