中文

EPIC-Fusion:面向第一人称动作识别的视听时序绑定

计算机视觉与模式识别 2019-08-23 v1

摘要

我们专注于第一人称动作识别的多模态融合,并提出了一种新颖的多模态时序绑定架构,即在时间偏移范围内组合模态。我们使用三种模态——RGB、光流和音频——来训练该架构,并通过中层级融合以及融合表示的稀疏时序采样将它们组合起来。与先前的工作相比,模态在时序聚合之前进行融合,并且模态权重和融合权重随时间共享。我们提出的架构是端到端训练的,其性能优于单个模态以及模态的后期融合。我们按类别展示了音频在第一人称视觉中的重要性,用于识别动作以及交互对象。我们的方法在最大的第一人称数据集EPIC-Kitchens的公开排行榜上,在已见和未见的测试集的所有指标上都取得了最先进的结果。

关键词

引用

@article{arxiv.1908.08498,
  title  = {EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition},
  author = {Evangelos Kazakos and Arsha Nagrani and Andrew Zisserman and Dima Damen},
  journal= {arXiv preprint arXiv:1908.08498},
  year   = {2019}
}

备注

Accepted for presentation at ICCV 2019