中文

LIGHTEN:利用图与分层时序网络学习视频中人机交互

计算机视觉与模式识别 2020-12-18 v1

摘要

从视频中分析人与物体之间的交互包括识别视频中人与物体之间的关系。它可被视为视觉关系检测的一个专门版本,其中物体之一必须是人。虽然传统方法将该问题表述为对视频片段序列的推断,我们提出了一种分层方法 LIGHTEN,以学习视觉特征,从而有效捕获视频中多粒度的时空线索。与当前方法不同,LIGHTEN 避免使用深度图或 3D 人体姿态等真值数据,从而也提高了在非 RGBD 数据集上的泛化能力。此外,我们仅使用视觉特征而非常用的手工设计空间特征来实现这一点。我们在 CAD-120 的人机交互检测(88.9% 和 92.6%)与预测任务上取得了最先进的结果,并在 V-COCO 数据集上基于图像的人机交互检测中取得了有竞争力的结果,为基于视觉特征的方法树立了新的基准。LIGHTEN 的代码可在 https://github.com/praneeth11009/LIGHTEN-Learning-Interactions-with-Graphs-and-Hierarchical-TEmporal-Networks-for-HOI 获取。

关键词

引用

@article{arxiv.2012.09402,
  title  = {LIGHTEN: Learning Interactions with Graph and Hierarchical TEmporal Networks for HOI in videos},
  author = {Sai Praneeth Reddy Sunkesula and Rishabh Dabral and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2012.09402},
  year   = {2020}
}

备注

9 pages, 6 figures, ACM Multimedia Conference 2020