用于高效视频识别的动作关键点网络
计算机视觉与模式识别
2023-02-08 v1
摘要
降低冗余对于提升视频识别模型的效率至关重要。一种有效方法是从整体视频中选取信息丰富的内容,由此产生了一类流行的动态视频识别方法。然而,现有动态方法独立地关注时间或空间选择,而忽略了一个现实:冗余通常是空间与时间同时存在的。此外,它们所选内容通常以固定形状裁剪,而信息丰富内容的真实分布可能更加多样。基于这两点认识,本文提出将时间与空间选择整合进动作关键点网络(AK-Net)。AK-Net从不同帧与位置选取散布于任意形状区域中的一些信息点作为一组动作关键点,进而将视频识别转化为点云分类。AK-Net包含两步,即关键点选择与点云分类。首先,它将视频输入基线网络并从中间层输出特征图。我们将该特征图上的每个像素视为一个时空点,并利用自注意力选取若干信息关键点。其次,AK-Net设计了一种排序准则将关键点排列为有序的一维序列。因此,AK-Net为效率带来双重收益:关键点选择步骤在任意形状内收集信息内容并提升建模时空依赖的效率,而点云分类步骤通过压缩卷积核进一步降低计算成本。实验结果表明,AK-Net能在多个视频识别基准上持续提升基线方法的效率与性能。
引用
@article{arxiv.2201.06304,
title = {Action Keypoint Network for Efficient Video Recognition},
author = {Xu Chen and Yahong Han and Xiaohan Wang and Yifan Sun and Yi Yang},
journal= {arXiv preprint arXiv:2201.06304},
year = {2023}
}