中文

用于可泛化深度度量学习的编码残差变换

计算机视觉与模式识别 2022-10-11 v1

摘要

深度度量学习中的一个基本挑战是特征嵌入网络模型的泛化能力,因为在训练类别上学习到的嵌入网络需在新的测试类别上评估。为应对该挑战,本文引入一种称为编码残差变换(CRT)的新方法用于深度度量学习,以显著提升其泛化能力。具体而言,我们学习一组多样化原型特征,将特征图投影至各原型,随后利用其与原型的相关性系数加权的投影残差对特征进行编码。所提CRT方法具有以下两个独特特征。第一,其基于向多样化原型的投影,从一组互补视角表示并编码特征图。第二,不同于现有基于Transformer的特征表示方法基于全局相关性分析对特征原始值编码,所提编码残差变换编码的是原始特征与其投影原型之间的相对差异。嵌入空间密度与谱衰减分析表明,这种向多样化原型的多元投影与编码残差表示能够在度量学习中实现显著改善的泛化能力。最后,为进一步提升泛化性能,我们提出在不同投影原型规模与嵌入维度的编码残差变换之间,对其特征相似度矩阵施加一致性约束。我们广泛的实验结果和消融研究证明,所提CRT方法大幅优于最先进的深度度量学习方法,并在CUB数据集上比当前最佳方法提升高达4.28%。

关键词

引用

@article{arxiv.2210.04180,
  title  = {Coded Residual Transform for Generalizable Deep Metric Learning},
  author = {Shichao Kan and Yixiong Liang and Min Li and Yigang Cen and Jianxin Wang and Zhihai He},
  journal= {arXiv preprint arXiv:2210.04180},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022