中文

面向可上传多源小样本域适应的视觉感知多模态提示微调

计算机视觉与模式识别 2025-03-11 v1

摘要

传统的多源域小样本适应(MFDA)在低资源场景下面临进一步减轻边缘端设备负载的挑战。考虑到 CLIP 的原生语言监督优势以及 prompt 在高效迁移 CLIP 方面的即插即用特性,本文提出了一种可上传的多源小样本域适应(UMFDA)方案。它属于边缘端模型中的去中心化边缘协同学习,这些模型必须保持较低的计算负载。并且仅提供源域数据中有限数量的标注,大部分数据为未标注数据。进一步,本文在去中心化方案下提出了一种视觉感知多模态提示微调框架(VAMP),其中视觉感知提示引导文本域特定提示,以保持语义判别性并感知域信息。跨模态语义和域分布对齐损失优化每个边缘端模型,而文本分类器一致性和语义多样性损失促进边缘端模型之间的协同学习。在 OfficeHome 和 DomainNet 数据集上进行了大量实验,以证明所提出的 VAMP 在 UMFDA 中的有效性,其性能优于以往的提示微调方法。

关键词

引用

@article{arxiv.2503.06106,
  title  = {Vision-aware Multimodal Prompt Tuning for Uploadable Multi-source Few-shot Domain Adaptation},
  author = {Kuanghong Liu and Jin Wang and Kangjian He and Dan Xu and Xuejie Zhang},
  journal= {arXiv preprint arXiv:2503.06106},
  year   = {2025}
}

备注

Accepted by AAAI 2025