AdaFuse:用于高效动作识别的自适应时间融合网络
计算机视觉与模式识别
2021-02-12 v1
摘要
时间建模是高效视频动作识别的关键。虽然理解时间信息可以提升动态动作的识别准确率,但去除时间冗余并复用过去特征可显著节省计算,从而实现高效动作识别。本文中,我们引入一种称为AdaFuse的自适应时间融合网络,该网络动态融合当前与过去特征图的通道以实现强时间建模。具体而言,历史卷积特征图中的必要信息与当前剪枝后的特征图相融合,旨在同时提升识别准确率与效率。此外,我们采用跳跃操作进一步降低动作识别的计算成本。在Something V1 & V2、Jester和Mini-Kinetics上的大量实验表明,我们的方法可在精度与最先进方法相当的情况下节省约40%的计算量。项目页面见 https://mengyuest.github.io/AdaFuse/
引用
@article{arxiv.2102.05775,
title = {AdaFuse: Adaptive Temporal Fusion Network for Efficient Action Recognition},
author = {Yue Meng and Rameswar Panda and Chung-Ching Lin and Prasanna Sattigeri and Leonid Karlinsky and Kate Saenko and Aude Oliva and Rogerio Feris},
journal= {arXiv preprint arXiv:2102.05775},
year = {2021}
}
备注
Accepted to ICLR2021