Learn2Augment:学习合成视频以用于动作识别中的数据增强
计算机视觉与模式识别
2022-07-26 v2
摘要
我们解决视频动作识别中的数据增强问题。视频中的标准增强策略是人工设计的,并且要么随机采样可能的增强数据点空间而不知哪些增强点更好,要么通过启发式方法采样。我们提议学习是什么成就了一段好的动作识别视频,并仅筛选高质量样本用于增强。具体而言,我们选择将前景视频与背景视频进行视频合成作为数据增强过程,这产生了多样且逼真的新样本。我们学习哪些视频对值得增强,而无需真正将它们合成。这缩减了可能增强的空间,具有两个优势:节省计算成本,并因增强视频对质量高于平均而提升最终训练分类器的准确率。我们在完整的训练设定谱系上呈现实验结果:少样本、半监督和全监督。我们观察到在所有设定上相较先前工作和基线的一致提升,在 Kinetics、UCF101、HMDB51 上,并在有限数据设定下达到新的最先进水平。我们在半监督设定下看到了高达 8.6% 的提升。
引用
@article{arxiv.2206.04790,
title = {Learn2Augment: Learning to Composite Videos for Data Augmentation in Action Recognition},
author = {Shreyank N Gowda and Marcus Rohrbach and Frank Keller and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2206.04790},
year = {2022}
}
备注
Accepted to ECCV-2022