中文

基于 EgoNet 的第一人称动作-物体检测

计算机视觉与模式识别 2017-06-13 v3

摘要

与安装在机器人上的传统第三人称相机不同,第一人称相机从近处捕捉人的视觉感觉运动物体交互。本文中,我们研究从第一人称相机出发,瞬时视觉注意力与对物体的运动动作之间的紧密相互作用。我们提出动作-物体(action-objects)的概念——即捕捉人有意识的视觉(看电视)或触觉(拿杯子)交互的物体。动作-物体可能依赖于任务,但由于许多任务共享常见的人-物空间配置,动作-物体表现出相对于人的特征性 3D 空间距离和方向。我们设计了一个预测模型,使用 EgoNet 检测动作-物体;EgoNet 是一个联合双流网络,整体整合视觉外观(RGB)和 3D 空间布局(深度和高度)线索,以预测逐像素的动作-物体似然。我们的网络还融入了第一人称坐标嵌入,旨在学习第一人称数据中动作-物体的空间分布。我们通过展示 EgoNet 持续优于先前基线方法,证明了其预测能力。此外,EgoNet 还展现出强大的泛化能力,即它能在新颖的第一人称数据集中预测语义有意义的物体。我们方法有效检测动作-物体的能力可用于改进机器人对人与物体交互的理解。

关键词

引用

@article{arxiv.1603.04908,
  title  = {First Person Action-Object Detection with EgoNet},
  author = {Gedas Bertasius and Hyun Soo Park and Stella X. Yu and Jianbo Shi},
  journal= {arXiv preprint arXiv:1603.04908},
  year   = {2017}
}