一张图像相当于16x16个词,那么一段视频相当于什么?
计算机视觉与模式识别
2021-05-28 v2
摘要
动作识别领域的领先方法试图从输入视频的空间和时间维度中提取信息。达到当前最优(SotA)精度的方法通常使用3D卷积层来从视频帧中抽象出时间信息。此类卷积的使用需要从输入视频中采样短片段,其中每个片段是一组紧密采样的帧。由于每个短片段仅覆盖输入视频的一小部分,在推理时需要采样多个片段以覆盖整个视频的时间长度。这导致计算负载增加,并且在现实世界应用中不切实际。我们通过显著减少推理所需的帧数来解决这一计算瓶颈。我们的方法依赖于一个时间Transformer,它对视频帧施加全局注意力,从而更好地利用每帧中的显著信息。因此,我们的方法输入效率很高,并且可以用极少的数据(每视频帧数)、计算和延迟在Kinetics数据集上取得SotA结果。具体而言,在Kinetics-400上,我们达到了的top-1精度,而每视频帧数减少,推理速度比当前领先方法快。代码见:https://github.com/Alibaba-MIIL/STAM
引用
@article{arxiv.2103.13915,
title = {An Image is Worth 16x16 Words, What is a Video Worth?},
author = {Gilad Sharir and Asaf Noy and Lihi Zelnik-Manor},
journal= {arXiv preprint arXiv:2103.13915},
year = {2021}
}