用于第一人称交互识别的三流融合网络
计算机视觉与模式识别
2020-02-20 v1
摘要
由于摄像者运动导致视频条件不稳定,第一人称交互识别是一项具有挑战性的任务。针对第一人称视角下的人体交互识别,本文提出一种包含两大部分的三流融合网络:三流架构与三流关联融合。三流架构捕捉目标外观、目标运动与相机自我运动的特征。同时,三流关联融合将三个流各自的特征图相结合,以考虑目标外观、目标运动与相机自我运动之间的关联。融合后的特征向量对相机运动具有鲁棒性,并补偿了相机自我运动的噪声。使用融合特征向量对短时片段建模,并采用长短期记忆(LSTM)模型考虑视频的时间动态。我们在两个公开基准数据集上评估了所提方法以验证其有效性。实验结果表明,所提融合方法成功生成了具有判别力的特征向量,且在发生显著相机自我运动的第一人称视频中,我们的网络优于所有对比的活动识别方法。
引用
@article{arxiv.2002.08219,
title = {Three-Stream Fusion Network for First-Person Interaction Recognition},
author = {Ye-Ji Kim and Dong-Gyu Lee and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2002.08219},
year = {2020}
}
备注
30 pages, 9 figures