中文

COSMo: 基于 CLIP 的开放集多目标域适应

计算机视觉与模式识别 2024-12-17 v2

摘要

多目标域适应(Multi-Target Domain Adaptation, MTDA)涉及从单一源域学习域无关信息并应用于多个未标记目标域。然而,现有 MTDA 方法主要关注视觉特征中的域迁移,往往忽略语义特征且难以处理未知类别,导致所谓的开放集多目标域适应(Open-Set MTDA)问题。虽然大规模视觉语言基础模型如 CLIP 显示出前景,但其在 MTDA 中的潜力尚未充分探索。本文引入 COSMo,一种新方法,通过源域引导的提示学习获取域无关提示,以解决 MTDA 中的问题。该方法利用域特定偏置网络和针对已知/未知类别的独立提示,有效实现跨域和类别迁移。据我们所知,COSMo 是首个解决开放集多目标域适应(OSMTDA)的方法,提供了更真实的现实场景表征,同时处理开放集和多目标域适应的挑战。COSMo 在三个具有挑战性的数据集上(Mini-DomainNet、Office-31、Office-Home)实现平均提升 5.1%5.1\%,显著优于其他相关域适应方法在 OSMTDA 设置下的表现。代码已公开:https://github.com/munish30monga/COSMo。

关键词

引用

@article{arxiv.2409.00397,
  title  = {COSMo: CLIP Talks on Open-Set Multi-Target Domain Adaptation},
  author = {Munish Monga and Sachin Kumar Giroh and Ankit Jha and Mainak Singha and Biplab Banerjee and Jocelyn Chanussot},
  journal= {arXiv preprint arXiv:2409.00397},
  year   = {2024}
}

备注

Accepted in BMVC 2024