用于视频动作识别的选择性体混合
计算机视觉与模式识别
2024-10-23 v2
摘要
卷积神经网络(CNNs)与视觉 Transformer 近期的进展已令人信服地展示出在大型数据集上用于视频动作识别的高学习能力。然而,深度模型常于训练视频数量有限的小规模数据集上遭受过拟合效应。一种常见解法是借助现有图像增强策略逐帧处理,包括 Mixup、Cutmix 与 RandAugment,而这些并非专为视频数据优化。本文中,我们提出一种名为选择性体混合(SV-Mix)的新颖视频增强策略,以改进深度模型在有限训练视频下的泛化能力。SV-Mix 设计一可学习选择模块,从两段视频中选取最具信息量的体并混合以得到新训练视频。技术上,我们提出两个新模块,即空间选择模块(为每个空间位置选取局部块)与时间选择模块(为每个时间戳混合整帧并保持空间模式)。每次我们随机选取两模块之一以扩充训练样本多样性。选择模块与视频动作识别框架联合优化以寻找最优增强策略。我们经实证在广泛视频动作识别基准上展示了 SV-Mix 增强的优长,并一致地提升基于 CNN 与基于 transformer 的模型性能。
引用
@article{arxiv.2309.09534,
title = {Selective Volume Mixup for Video Action Recognition},
author = {Yi Tan and Zhaofan Qiu and Yanbin Hao and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:2309.09534},
year = {2024}
}