中文

稳定且富有表达力的循环视觉模型

计算机视觉与模式识别 2020-10-26 v2 机器学习

摘要

灵长类视觉依赖循环处理来实现可靠感知。越来越多的文献也表明,循环连接能提升视觉模型在经典计算机视觉挑战中的学习效率和泛化能力。那么,为何当前的大规模挑战仍由前馈网络主导?我们推测,循环视觉模型的有效性受限于训练它们的标准算法——“随时间反向传播”(BPTT),该算法训练一个 N 步模型的内存复杂度为 O(N)。因此,循环视觉模型的设计受内存限制,迫使人们在媲美领先前馈模型的巨大容量与通过精细复杂动态来弥补这一不足之间做出选择。在此,我们开发了一种新的学习算法——“收缩循环反向传播”(C-RBP),它通过实现循环处理步数恒定的 O(1) 内存复杂度来缓解这些问题。我们证明,用 C-RBP 训练的循环视觉模型能够在合成轮廓追踪任务中检测到长程空间依赖关系,而 BPTT 训练的模型则不能。我们进一步证明,用 C-RBP 训练以解决大规模全景分割 MS-COCO 挑战的循环视觉模型,以更少的自由参数超越了领先的前馈方法。C-RBP 是一种通用学习算法,适用于任何能从扩展循环动态中受益的应用。代码和数据可在 https://github.com/c-rbp 获取。

关键词

引用

@article{arxiv.2005.11362,
  title  = {Stable and expressive recurrent vision models},
  author = {Drew Linsley and Alekh Karkada Ashok and Lakshmi Narasimhan Govindarajan and Rex Liu and Thomas Serre},
  journal= {arXiv preprint arXiv:2005.11362},
  year   = {2020}
}

备注

Published at NeurIPS 2020