中文

跨域微调原型与图像之间的鸿沟

计算机视觉与模式识别 2024-10-22 v2 机器学习

摘要

在跨域零样本分类 (CFC) 中,最近的研究主要 focus 在在冻结的预训练主干网络上添加简单的变换头,以将嵌入投影到特定任务的度量空间,在该空间中可以通过测量图像实例与原型表示之间的相似性来进行分类。技术上,这种框架隐式假设了原型和图像实例嵌入共享相同的表示变换。然而,本文指出,在冻结的预训练主干网络中,原型和图像实例嵌入之间自然存在一种类似于模式鸿沟的差距,而仅对原型和图像分别应用相同的变换会限制探索最优表示的可能性,并缩小原型与图像表示之间的差距。为解决此问题,我们提出一种简单而有效的方法,对抗性原型-图像适应 (CoPA),分别为原型和图像设计不同的变换,类似地对待原型作为文本提示。大量实验表明,CoPA 在 Meta-Dataset 上实现了更有效的 SOTA 性能。同时,进一步分析也表明,CoPA 能够学习更好的表示聚类,扩大差距,并在扩大的差距下实现最小验证损失。

关键词

引用

@article{arxiv.2410.12474,
  title  = {Mind the Gap Between Prototypes and Images in Cross-domain Finetuning},
  author = {Hongduan Tian and Feng Liu and Zhanke Zhou and Tongliang Liu and Chengqi Zhang and Bo Han},
  journal= {arXiv preprint arXiv:2410.12474},
  year   = {2024}
}