中文

利用视觉语言预训练的无监督域适应

计算机视觉与模式识别 2024-08-06 v1

摘要

本文聚焦于利用视觉语言预训练(VLP)模型解决无监督域适应(UDA)中的两个关键挑战。首先,UDA 主要依赖 ImageNet 预训练模型,但 VLP 模型在 UDA 中的潜力尚未得到充分探索。VLP 模型的丰富表征对增强 UDA 任务具有重要前景。为此,我们提出一种新方法,称为跨模态知识蒸馏(CMKD),利用 VLP 模型作为教师模型指导目标域中的学习过程,从而实现领先性能。其次,当前的 UDA 范式涉及为每个任务训练separate model,导致存储开销巨大,且随着迁移任务数量的增加,实际部署变得不切实际。为克服这一挑战,我们引入残差稀疏训练(RST),利用 VLP 广泛预训练所带来的优势,需要对 VLP 模型参数进行最小调整(约 0.1%\sim0.5%)即可实现与微调相当的性能。将 CMKD 和 RST 结合,我们提供了一个综合解决方案,有效地利用 VLP 模型进行 UDA 任务,同时减少模型部署的存储开销。此外,CMKD 可作为与 FixMatch 等其他方法的基线,提高 UDA 的性能。我们的方法在标准基准测试中超越了现有技术。我们的代码将在 https://github.com/Wenlve-Zhou/VLP-UDA 上提供。

关键词

引用

@article{arxiv.2408.02192,
  title  = {Unsupervised Domain Adaption Harnessing Vision-Language Pre-training},
  author = {Wenlve Zhou and Zhiheng Zhou},
  journal= {arXiv preprint arXiv:2408.02192},
  year   = {2024}
}