视频识别中多看而少虑
计算机视觉与模式识别
2022-11-21 v1 人工智能
机器学习
摘要
现有的动作识别方法通常采样少数帧来表示每个视频,以避免巨大的计算量,这常常限制了识别性能。为解决这个问题,我们提出充裕与聚焦网络(AFNet),它由两条分支组成,以利用更多帧但更少计算。具体而言,充裕分支取所有输入帧,以压缩的计算获得丰富信息,并通过所提出的导航模块为聚焦分支提供指导;聚焦分支压缩时间维度尺寸,仅关注每个卷积块中的显著帧;最终,两分支的结果被自适应融合以防止信息丢失。通过此设计,我们可以向网络引入更多帧但花费更少计算。此外,我们证明AFNet能在达到更高精度的同时使用更少帧,因为中间特征的动态选择强化了隐式时间建模。进一步,我们展示我们的方法可扩展至以更低代价减少空间冗余。在五个数据集上的大量实验证明了我们方法的有效性与高效性。
引用
@article{arxiv.2211.09992,
title = {Look More but Care Less in Video Recognition},
author = {Yitian Zhang and Yue Bai and Huan Wang and Yi Xu and Yun Fu},
journal= {arXiv preprint arXiv:2211.09992},
year = {2022}
}
备注
Accepted by NeurIPS 2022