Re^2TAL:为可逆时序动作定位重构预训练视频骨干网络
计算机视觉与模式识别
2023-03-29 v2 人工智能
多媒体
摘要
时序动作定位(TAL)需要长时序推理以预测不同时长和复杂内容的动作。在有限GPU内存下,在长视频上端到端(即从视频到预测)训练TAL是一项重大挑战。大多数方法只能在预提取特征上训练,而无法针对定位问题优化特征,从而限制了定位性能。在本工作中,为拓展TAL网络的潜力,我们提出一种新颖的端到端方法Re2TAL,其为可逆TAL重构预训练视频骨干网络。Re2TAL构建带有可逆模块的骨干网络,其中输入可从输出恢复,从而在训练期间可从内存中清除庞大的中间激活。我们未设计单一类型的可逆模块,而是提出一种网络重构机制,将任何带残差连接的模块转化为可逆模块而不改变任何参数。这带来两点益处:(1)可从现有乃至未来的模型设计轻松获得大量可逆网络;(2)可逆模型复用其原始不可逆版本的预训练参数,所需训练代价小得多。Re2TAL仅使用RGB模态,在ActivityNet-v1.3上达到37.01%的平均mAP,创下新的SOTA记录,并在THUMOS-14上tIoU=0.5时mAP达64.9%,优于所有其他仅用RGB的方法。
引用
@article{arxiv.2211.14053,
title = {Re^2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action Localization},
author = {Chen Zhao and Shuming Liu and Karttikeya Mangalam and Bernard Ghanem},
journal= {arXiv preprint arXiv:2211.14053},
year = {2023}
}