中文

面向端到端主动物体识别的循环三维注意力网络

计算机视觉与模式识别 2022-01-12 v4

摘要

主动视觉本质上是注意力驱动的:智能体主动选择要关注的视图,以便在改善其对所观察场景的内部表征的同时,快速完成视觉任务。受近期基于注意力的模型在基于单张RGB图像的二维视觉任务中取得成功的启发,我们提出利用注意力机制,通过开发一种端到端的循环三维注意力网络,来解决基于多视图深度的主动物体识别问题。该架构利用循环神经网络(RNN)来存储和更新内部表征。我们的模型使用三维形状数据集进行训练,能够迭代地关注针对感兴趣物体的最佳视图以进行识别。为实现三维视图选择,我们推导出一个三维空间变换网络,该网络可微分,便于通过反向传播进行训练,其收敛速度远快于大多数现有基于注意力模型所采用的强化学习方法。实验表明,我们的方法仅使用深度输入,在时间效率和识别准确率方面均达到了最先进的下一最佳视图性能。

关键词

引用

@article{arxiv.1610.04308,
  title  = {Recurrent 3D Attentional Networks for End-to-End Active Object Recognition},
  author = {Min Liu and Yifei Shi and Lintao Zheng and Kai Xu and Hui Huang and Dinesh Manocha},
  journal= {arXiv preprint arXiv:1610.04308},
  year   = {2022}
}