借我少许时间上下文之力:多模态自我中心动作识别
计算机视觉与模式识别
2021-11-02 v1 声音
音频与语音处理
摘要
在自我中心视频中,动作接连快速发生。我们利用动作的时间上下文,提出一种学习关注周边动作以提升识别性能的方法。为纳入时间上下文,我们提出一种基于 transformer 的多模态模型,以视频与音频为输入模态,并借助显式语言模型提供动作序列上下文以增强预测。我们在 EPIC-KITCHENS 与 EGTEA 数据集上测试了该方法,报告了当前最优性能。我们的消融实验展示了利用时间上下文以及纳入音频输入模态与语言模型对预测重打分的好处。代码与模型见:https://github.com/ekazakos/MTCN。
引用
@article{arxiv.2111.01024,
title = {With a Little Help from my Temporal Context: Multimodal Egocentric Action Recognition},
author = {Evangelos Kazakos and Jaesung Huh and Arsha Nagrani and Andrew Zisserman and Dima Damen},
journal= {arXiv preprint arXiv:2111.01024},
year = {2021}
}
备注
Accepted at BMVC 2021