中文

用于多视图三维重建的深度特征集鲁棒注意力聚合

计算机视觉与模式识别 2019-08-20 v2 人工智能 机器学习 机器人学

摘要

我们研究从一组图像恢复底层三维形状的问题。现有的基于学习的方法通常借助循环神经网络(如 GRU)或直观的池化操作(如最大/平均池化)来融合从输入图像编码的多个深度特征。然而,基于 GRU 的方法在给定同一组输入图像的不同排列时无法一致地估计三维形状,因为循环单元是排列变的。由于 GRU 的长时间记忆丢失,也不太可能通过更多图像来细化三维形状。常用的池化方法局限于捕获部分信息(如最大/平均值),忽略了其他有价值的特征。本文中,我们提出一种新的前馈神经模块 AttSets 及专用训练算法 FASet,以注意力方式聚合任意大小的深度特征集用于多视图三维重建。AttSets 模块具有排列不变性、计算高效且易于实现,而 FASet 算法使基于 AttSets 的网络对任意数量输入图像具有显著鲁棒性和泛化能力。我们在多个大型公开数据集上全面评估了 FASet 和 AttSets 的性质。大量实验表明,AttSets 结合 FASet 算法显著优于现有的聚合方法。

关键词

引用

@article{arxiv.1808.00758,
  title  = {Robust Attentional Aggregation of Deep Feature Sets for Multi-view 3D Reconstruction},
  author = {Bo Yang and Sen Wang and Andrew Markham and Niki Trigoni},
  journal= {arXiv preprint arXiv:1808.00758},
  year   = {2019}
}

备注

IJCV 2019. Code and data are available at https://github.com/Yang7879/AttSets