中文

VirDA:基于视觉重编程的无监督域适应

计算机视觉与模式识别 2025-12-08 v4

摘要

现有的无监督域适应 (UDA) 流程为每个新的 source-target 对都微调已很好的 backbone 参数,导致训练参数和存储内存随每个新配对线性增长,同时也阻止了这些经过训练的 backbone 参数的复用。灵感来自最近的发现:现有 backbone 具有文本ural bias。我们提出利用 domain-specific 文本ural bias 通过视觉重编程进行域适应,称之为 VirDA。不对 backbone 进行微调,VirDA 在 backbone 之前添加一个 domain-specific 视觉重编程层。该层产生视觉 prompts,作为输入图像的添加文本ural bias,以适应目标域的“风格”。为优化这些视觉重编程层,我们使用多个目标函数在应用 domain-adapting visual prompts 时优化 intra-和 inter-domain distribution 的差异。该过程无需修改 backbone 参数,允许相同 backbone 在不同域之间复用。在 Office-31 数据集上评估,VirDA 以 92.8% 的平均准确率仅使用 1.5M 可训练参数。VirDA 以 +1.6% 的准确率优于 PDA(当前参数高效 UDA 基线),同时仅使用其参数的 46%。相对于 full-backbone 微调,VirDA 分别以 +0.2% 和 +1.4% 的准确率优于 CDTrans 和 FixBi,仅需其可训练参数的 1.7% 和 2.8%。相对于当前最强方法(PMTrans 和 TVT),VirDA 仅使用约 1.7% 的参数,准确率分别仅分别损失 2.2% 和 1.1%。

关键词

引用

@article{arxiv.2510.01660,
  title  = {VirDA: Reusing Backbone for Unsupervised Domain Adaptation with Visual Reprogramming},
  author = {Duy Nguyen and Dat Nguyen},
  journal= {arXiv preprint arXiv:2510.01660},
  year   = {2025}
}

备注

To be published in TMLR