一言胜千图:通过语言引导蒸馏 CLIP 的领域泛化
计算机视觉与模式识别
2023-09-25 v1
摘要
领域泛化研究的问题是:用来自若干领域(或分布)的样本训练模型,然后用来自新的、未见领域的样本测试该模型。在本文中,我们提出了一种新颖的领域泛化方法,其利用大型视觉-语言模型的最新进展,具体为一个 CLIP 教师模型,来训练一个可泛化到未见领域的较小模型。关键技术贡献是一种新型正则化,要求学生学习到的图像表示接近于教师对图像相应文本描述进行编码所得到的文本表示。我们引入了绝对距离与相对距离两种损失函数设计,为应如何正则化学生模型的训练过程提供了具体指导。我们在多个基准数据集上评估了所提方法(称为 RISE,即基于语义嵌入的正则化不变性),结果表明其优于多种最先进的领域泛化方法。据我们所知,我们的工作是首个利用大型视觉-语言模型的知识蒸馏进行领域泛化的。通过融入基于文本的信息,RISE 提升了机器学习模型的泛化能力。
引用
@article{arxiv.2309.12530,
title = {A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language Guidance},
author = {Zeyi Huang and Andy Zhou and Zijian Lin and Mu Cai and Haohan Wang and Yong Jae Lee},
journal= {arXiv preprint arXiv:2309.12530},
year = {2023}
}
备注
to appear at ICCV2023