中文

使用 CoordConv 门控循环网络进行序列中的物体解析

计算机视觉与模式识别 2019-10-03 v1

摘要

我们提出了一种单目物体解析框架,通过捕获序列数据上的时间相关性来实现一致的关键点定位。在本文中,我们提出了一种基于循环网络的新架构,以建模中间特征之间的长程依赖关系,这些特征在关键点定位和跟踪等任务中非常有用。我们利用流行的堆叠沙漏架构的表现力,并通过在网络的各中间层之间采用内存单元(权重在视频帧的各阶段间共享)来增强它。我们观察到,这种权重共享方案不仅使我们能够将沙漏架构构建为循环网络,而且被证明在产生序列任务日益精细的估计方面非常有效。此外,我们提出了一种新的存储单元,称为 CoordConvGRU,它学习选择性地保留时空相关性,并展示了我们在关键点定位任务上的结果。实验表明,我们的方法能够建模帧之间的运动动态,并显著优于基线沙漏网络。尽管我们的网络在合成渲染数据集上训练,我们观察到仅在 300 张真实图像上进行最小微调,就能达到与以相同监督输入水平训练的各种最先进(SOTA)方法相当的性能。通过使用比其他方法更简单的架构,我们能够在标准 GPU 上实时运行,这是此类应用所期望的。最后,我们公开了我们的架构以及来自 KITTI 数据集的 524 个标注车辆序列。

关键词

引用

@article{arxiv.1910.00895,
  title  = {Object Parsing in Sequences Using CoordConv Gated Recurrent Networks},
  author = {Ayush Gaud and Y V S Harish and K Madhava Krishna},
  journal= {arXiv preprint arXiv:1910.00895},
  year   = {2019}
}