不留一帧:全视频动作识别
计算机视觉与模式识别
2021-03-30 v1
摘要
并非所有视频帧对于动作识别都具有同等的信息量。当动作在数百帧中展开时,在所有视频帧上训练深度网络在计算上不可行。一种常见的启发式方法是均匀采样少量视频帧并用这些帧识别动作。相反,本文提出全视频动作识别并考虑所有视频帧。为使计算可行,我们首先根据帧在分类任务上的相似性沿时间维度对所有帧激活进行聚类,然后将簇中的帧在时间上聚合为较少数量的表示。我们的方法是端到端可训练的且计算高效,因为它依赖于时间局部化聚类并结合特征空间中的快速汉明距离。我们在UCF101、HMDB51、Breakfast以及Something-Something V1和V2上进行了评估,相较于现有启发式帧采样方法具有优势。
引用
@article{arxiv.2103.15395,
title = {No frame left behind: Full Video Action Recognition},
author = {Xin Liu and Silvia L. Pintea and Fatemeh Karimi Nejadasl and Olaf Booij and Jan C. van Gemert},
journal= {arXiv preprint arXiv:2103.15395},
year = {2021}
}
备注
Accepted to CVPR 2021