EPIC-Fusion:面向第一人称动作识别的视听时序绑定
计算机视觉与模式识别
2019-08-23 v1
摘要
我们专注于第一人称动作识别的多模态融合,并提出了一种新颖的多模态时序绑定架构,即在时间偏移范围内组合模态。我们使用三种模态——RGB、光流和音频——来训练该架构,并通过中层级融合以及融合表示的稀疏时序采样将它们组合起来。与先前的工作相比,模态在时序聚合之前进行融合,并且模态权重和融合权重随时间共享。我们提出的架构是端到端训练的,其性能优于单个模态以及模态的后期融合。我们按类别展示了音频在第一人称视觉中的重要性,用于识别动作以及交互对象。我们的方法在最大的第一人称数据集EPIC-Kitchens的公开排行榜上,在已见和未见的测试集的所有指标上都取得了最先进的结果。
引用
@article{arxiv.1908.08498,
title = {EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition},
author = {Evangelos Kazakos and Arsha Nagrani and Andrew Zisserman and Dima Damen},
journal= {arXiv preprint arXiv:1908.08498},
year = {2019}
}
备注
Accepted for presentation at ICCV 2019