中文

学习表示不变性以实现数据高效动作识别

计算机视觉与模式识别 2022-11-21 v3

摘要

数据增强是一种在标注数据稀缺时改善图像分类的通用技术。约束模型预测对多种数据增强保持不变,有效地将所需的表示不变性(如对照度变化的不变性)注入模型,并有助于提升准确率。相较于图像数据,由于额外的时序维度,视频中的外观变化远为复杂。然而,视频的数据增强方法仍缺乏充分探索。本文研究了捕获不同视频不变性的多种数据增强策略,包括光度、几何、时序以及演员/场景增强。当与现有半监督学习框架结合时,我们表明我们的数据增强策略在低标签机制下的 Kinetics-100/400、Mini-Something-v2、UCF-101 和 HMDB-51 数据集上带来了可观的性能。我们还在全监督设定下验证了数据增强策略,并展示了性能提升。

关键词

引用

@article{arxiv.2103.16565,
  title  = {Learning Representational Invariances for Data-Efficient Action Recognition},
  author = {Yuliang Zou and Jinwoo Choi and Qitong Wang and Jia-Bin Huang},
  journal= {arXiv preprint arXiv:2103.16565},
  year   = {2022}
}

备注

Accepted to CVIU. Project page: https://yuliang.vision/video-data-aug