中文

基于CNN的ViT学习:用于域适应的显式类别边界混合模型

计算机视觉与模式识别 2024-04-29 v3

摘要

大多数域适应(DA)方法基于卷积神经网络(CNN)或视觉转换器(ViT)。它们在编码器上对域之间分布差异进行对齐,而不考虑其独特特征。例如,ViT因其捕获全局表示的优越能力而在准确性方面占据优势,而CNN在捕获局部表示方面具有优势。这导致我们设计一种混合方法,充分利用ViT和CNN的优势,称为显式类别边界(ECB)。ECB在ViT上学习CNN以组合其独特优势。具体而言,我们利用ViT的特性通过最大化两个分类器输出之间的差异来显式找到类别特定的决策边界,以检测来自源支持的目标样本远离的样本。相反,CNN编码器通过最小化两个分类器概率之间的差异来基于之前定义的类别特定边界对目标特征进行聚类。最后,ViT和CNN相互交换知识以提高伪标签的质量并减少这些模型的知识差异。与常规DA方法相比,我们的ECB实现了卓越的性能,这验证了这种混合模型的有效性。项目网站可在 https://dotrannhattuong.github.io/ECB/website 查找。

关键词

引用

@article{arxiv.2403.18360,
  title  = {Learning CNN on ViT: A Hybrid Model to Explicitly Class-specific Boundaries for Domain Adaptation},
  author = {Ba Hung Ngo and Nhat-Tuong Do-Tran and Tuan-Ngoc Nguyen and Hae-Gon Jeon and Tae Jong Choi},
  journal= {arXiv preprint arXiv:2403.18360},
  year   = {2024}
}

备注

Project page: https://dotrannhattuong.github.io/ECB/website, Accepted to CVPR 2024