每一刻都重要:复杂视频中动作的密集详细标注
计算机视觉与模式识别
2017-06-12 v3
摘要
在动作识别中,每一刻都至关重要。对视频中人类活动的全面理解需要根据发生的动作为每一帧进行标注,在视频序列上密集地放置多个标签。为研究这一问题,我们扩展了现有的 THUMOS 数据集并引入了 MultiTHUMOS,这是一个在无约束互联网视频上进行密集标注的新数据集。对多个密集标签的建模受益于类别内部和类别之间的时序关系。我们定义了一种新颖的长短期记忆 (LSTM) 深度网络变体,通过多个输入和输出连接来建模这些时序关系。我们表明,该模型提高了动作标注的准确性,并进一步实现了从结构化检索到动作预测等更深层次的理解任务。
引用
@article{arxiv.1507.05738,
title = {Every Moment Counts: Dense Detailed Labeling of Actions in Complex Videos},
author = {Serena Yeung and Olga Russakovsky and Ning Jin and Mykhaylo Andriluka and Greg Mori and Li Fei-Fei},
journal= {arXiv preprint arXiv:1507.05738},
year = {2017}
}
备注
To appear in IJCV