中文

VA-RED$^2$:视频自适应冗余削减

计算机视觉与模式识别 2021-10-06 v2

摘要

由于实现鲁棒识别需要大量计算资源,在深度学习视频模型上进行推理仍具挑战。真实世界视频的一个固有特性是跨帧信息高度相关,这会在模型的时间或空间特征图(或两者兼而有之)中转化为冗余。冗余特征的类型取决于视频中的动态与事件类型:静态视频具有更多时间冗余,而关注物体的视频往往具有更多通道冗余。本文提出一个称为 VA-RED2^2 的冗余削减框架,该框架依赖于输入。具体而言,我们的 VA-RED2^2 框架使用输入依赖的策略来决定时间维和通道维需要计算多少特征。为保持原模型的能力,在充分计算必要特征后,我们利用廉价的线性运算从这些数据中重建剩余的冗余特征。我们以可微分的方式通过共享权重机制将自适应策略与网络权重联合学习,使其极为高效。在多个视频数据集和不同视觉任务上的大量实验表明,与最先进的方法相比,我们的框架在计算量(FLOPs)上实现了 20%40%20\% - 40\% 的削减,且没有任何性能损失。项目页面:http://people.csail.mit.edu/bpan/va-red/。

关键词

引用

@article{arxiv.2102.07887,
  title  = {VA-RED$^2$: Video Adaptive Redundancy Reduction},
  author = {Bowen Pan and Rameswar Panda and Camilo Fosco and Chung-Ching Lin and Alex Andonian and Yue Meng and Kate Saenko and Aude Oliva and Rogerio Feris},
  journal= {arXiv preprint arXiv:2102.07887},
  year   = {2021}
}

备注

Accepted in ICLR 2021