中文

体积变换器网络

计算机视觉与模式识别 2020-07-21 v1

摘要

现有在深度卷积神经网络(CNN)中编码空间不变性的技术对所有特征通道施加相同的扭曲场。这未考虑到各个特征通道可代表不同语义部分,这些部分相对于规范构型可能经历不同的空间变换。为克服此局限,我们引入一个可学习模块——体积变换器网络(VTN),其预测逐通道扭曲场,以在空间上和通道上重新配置中间CNN特征。我们将VTN设计为编码器-解码器网络,设有专门模块让信息在特征通道间流动,以考虑语义部分间的依赖关系。我们进一步提出在成对实例的扭曲特征间定义的损失函数,提升了VTN的定位能力。实验表明,VTN持续增强特征的表征能力,进而提高网络在细粒度图像识别和实例级图像检索上的准确率。

关键词

引用

@article{arxiv.2007.09433,
  title  = {Volumetric Transformer Networks},
  author = {Seungryong Kim and Sabine Süsstrunk and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2007.09433},
  year   = {2020}
}

备注

ECCV 2020