利用时间注意力滤波器学习活动视频中的潜在子事件
计算机视觉与模式识别
2016-12-28 v3
摘要
本文新近引入时间注意力滤波器的概念,并阐述其如何用于视频中的人体活动识别。许多高层活动通常由多个具有不同时长/速度的时间部分(如子事件)组成,我们的目标是使模型利用多个注意力滤波器显式地学习此种时间结构并从中获益。我们的时间滤波器被设计为完全可微分,从而允许将时间滤波器与底层的基于帧或基于片段的卷积神经网络架构进行端到端训练。本文提出一种学习一组最优静态时间注意力滤波器并在不同视频间共享的方法,并将该方法扩展为利用循环长短期记忆网络(LSTM)针对每个测试视频动态调整注意力滤波器。这使得我们的时间注意力滤波器能够学习与每个活动特定的潜在子事件。我们通过实验确认所提出的时间注意力滤波器概念有益于活动识别,并对学习到的潜在子事件进行了可视化。
引用
@article{arxiv.1605.08140,
title = {Learning Latent Sub-events in Activity Videos Using Temporal Attention Filters},
author = {AJ Piergiovanni and Chenyou Fan and Michael S. Ryoo},
journal= {arXiv preprint arXiv:1605.08140},
year = {2016}
}