中文

学习等变表示

计算机视觉与模式识别 2020-12-07 v1 机器学习

摘要

最先进的深度学习系统常需大量数据与计算。因此,利用数据已知或未知的结构至关重要。卷积神经网络(CNNs)是该原则的成成功范例,其定义性特征为平移等变性。通过在输入上滑动滤波器,当输入平移时响应同量平移,从而利用语义内容独立于绝对像素位置的自然图像结构。此性质对 CNNs 在音频、图像与视频识别任务中的成功必不可少。本论文将等变性扩展至其他变换,如旋转与缩放。我们针对由对称群定义的不同变换提出等变模型。主要贡献为:(i) 极坐标变换网络,实现平面相似群上的等变;(ii) 等变多视图网络,实现二十面体对称群的等变;(iii) 球面 CNNs,实现连续 3D 旋转群的等变;(iv) 跨域图像嵌入,对 2D 输入实现 3D 旋转等变;(v) 自旋加权球面 CNNs,推广球面 CNNs 并对球面向量场实现 3D 旋转等变。应用包括图像分类、3D 形状分类与检索、全景图像分类与分割、形状对齐与姿态估计。这些模型共性在于利用数据对称性降低样本与模型复杂度并改善泛化性能。优势在(但不限于)数据有限或存在任意旋转等输入扰动的挑战性任务上更为显著。

关键词

引用

@article{arxiv.2012.02771,
  title  = {Learning Equivariant Representations},
  author = {Carlos Esteves},
  journal= {arXiv preprint arXiv:2012.02771},
  year   = {2020}
}