PGT:一种用于长视频模型训练的渐进式方法
计算机视觉与模式识别
2021-03-23 v1
摘要
卷积视频模型的计算复杂度比其图像级对应模型高一个数量级。受计算资源限制,目前尚无模型或训练方法能够端到端训练长视频序列。当前主流方法是将原始视频切分为片段,导致时间信息流不完整且碎片化。受处理长句的自然语言处理技术启发,我们提出将视频视为满足马尔可夫性质的串行片段,并通过多步沿时间维度渐进式传播信息将其作为整体训练。该渐进式训练(PGT)方法能够在有限资源下端到端训练长视频,并确保信息的有效传输。作为一种通用且鲁棒的训练方法,我们通过实证表明其在不同模型与数据集上均带来显著性能提升。作为一个示例,所提方法在参数与计算开销可忽略的情况下,在Charades上使SlowOnly网络提升3.7 mAP,在Kinetics上提升1.9 top-1准确率。代码见https://github.com/BoPang1996/PGT。
引用
@article{arxiv.2103.11313,
title = {PGT: A Progressive Method for Training Models on Long Videos},
author = {Bo Pang and Gao Peng and Yizhuo Li and Cewu Lu},
journal= {arXiv preprint arXiv:2103.11313},
year = {2021}
}
备注
CVPR21, Oral