VideoMix:重新思考视频分类中的数据增强
计算机视觉与模式识别
2020-12-08 v1
摘要
最先进的视频动作分类器常受过拟合困扰。它们往往偏向于特定的物体与场景线索,而非前景动作内容,导致泛化性能欠佳。近期有报道称数据增强策略可解决静态图像分类器中的过拟合问题。尽管在静态图像分类器上有效,数据增强在视频上的研究甚少。我们在该领域首次系统分析了多种数据增强策略在视频分类任务上的功效,进而提出了一种强有力的增强策略 VideoMix。VideoMix 通过将一个视频长方体插入另一视频来创建新的训练视频。真实标签按各视频体素数比例混合。我们表明 VideoMix 使模型能够超越物体与场景偏置,提取更稳健的动作识别线索。VideoMix 在 Kinetics 与颇具挑战的 Something-Something-V2 基准上持续优于其他增强基线,并提升了在 THUMOS'14 上的弱监督动作定位性能。VideoMix 预训练模型在视频检测任务(AVA)上展现出更高的准确率。
引用
@article{arxiv.2012.03457,
title = {VideoMix: Rethinking Data Augmentation for Video Classification},
author = {Sangdoo Yun and Seong Joon Oh and Byeongho Heo and Dongyoon Han and Jinhyung Kim},
journal= {arXiv preprint arXiv:2012.03457},
year = {2020}
}
备注
15 pages