中文

AVT:通过自编码变分变换无监督学习变换等变表示

计算机视觉与模式识别 2019-07-24 v3

摘要

由 Hinton 等人 \cite{hinton2011transforming} 引入的变换等变表示(TERs)学习,已被视为揭示各种变换下视觉结构的一项原则。其包含著名的卷积神经网络(CNNs)作为仅对平移等变的特例。相反,我们寻求为一般变换类训练 TERs,并以{\em 无监督}方式训练它们。为此,我们提出了一种通过自编码变分变换(AVT)的新颖原则性方法,相较于自编码数据的传统方法。形式上,给定变换后的图像,AVT 通过最大化变换与表示之间的互信息来训练网络。这确保所得各图像的 TERs 包含其视觉结构的{\em 内在}信息,该信息在一般{\em 非线性}情形下会于各种变换下{\em 不可分地}等变。在技术上,我们表明所得优化问题可通过最大化互信息的变分下界高效求解。该变分方法引入变换解码器以近似难以处理的变换后验,从而形成具有表示编码器与变换解码器一对组件的自编码架构。实验表明,所提 AVT 模型在无监督任务上创下性能新纪录,大幅缩小了与监督模型间的性能差距。

关键词

引用

@article{arxiv.1903.10863,
  title  = {AVT: Unsupervised Learning of Transformation Equivariant Representations by Autoencoding Variational Transformations},
  author = {Guo-Jun Qi and Liheng Zhang and Chang Wen Chen and Qi Tian},
  journal= {arXiv preprint arXiv:1903.10863},
  year   = {2019}
}

备注

http://maple-lab.net/projects/AVT.htm. arXiv admin note: text overlap with arXiv:1901.04596