PracticalDG:面向混合域泛化的视觉-语言模型扰动蒸馏
计算机视觉与模式识别
2024-04-16 v1 机器学习
摘要
域泛化(DG)旨在解决源域和目标域之间的分布偏移,当前的DG方法默认设定源域和目标域的数据共享相同的类别。然而,在实际场景中,目标域存在未见过的类别。为解决此问题,开放集域泛化(OSDG)应运而生,并已专门提出了若干方法。然而,大多数现有方法采用复杂架构,与DG方法相比提升甚微。近期,视觉-语言模型(VLM)遵循微调范式被引入DG,但大型视觉模型会消耗巨大的训练开销。因此,本文创新性地将知识从VLM迁移到轻量级视觉模型,并通过从分数、类别和实例(SCI)三个角度引入扰动蒸馏(PD),即SCI-PD,来提高鲁棒性。此外,先前的方法面向具有相同且固定划分的基准,忽略了源域之间的差异。我们提出的新基准混合域泛化(HDG)和新指标-CV揭示了这些方法在性能上的急剧下降,该基准通过构建多种划分来全面评估算法的鲁棒性。大量实验表明,我们的方法在多个数据集上优于最先进的算法,尤其是在面对数据稀缺时提高了鲁棒性。
引用
@article{arxiv.2404.09011,
title = {PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization},
author = {Zining Chen and Weiqiu Wang and Zhicheng Zhao and Fei Su and Aidong Men and Hongying Meng},
journal= {arXiv preprint arXiv:2404.09011},
year = {2024}
}
备注
Accepted to CVPR2024