学习表示不变性以实现数据高效动作识别
计算机视觉与模式识别
2022-11-21 v3
摘要
数据增强是一种在标注数据稀缺时改善图像分类的通用技术。约束模型预测对多种数据增强保持不变,有效地将所需的表示不变性(如对照度变化的不变性)注入模型,并有助于提升准确率。相较于图像数据,由于额外的时序维度,视频中的外观变化远为复杂。然而,视频的数据增强方法仍缺乏充分探索。本文研究了捕获不同视频不变性的多种数据增强策略,包括光度、几何、时序以及演员/场景增强。当与现有半监督学习框架结合时,我们表明我们的数据增强策略在低标签机制下的 Kinetics-100/400、Mini-Something-v2、UCF-101 和 HMDB-51 数据集上带来了可观的性能。我们还在全监督设定下验证了数据增强策略,并展示了性能提升。
引用
@article{arxiv.2103.16565,
title = {Learning Representational Invariances for Data-Efficient Action Recognition},
author = {Yuliang Zou and Jinwoo Choi and Qitong Wang and Jia-Bin Huang},
journal= {arXiv preprint arXiv:2103.16565},
year = {2022}
}
备注
Accepted to CVIU. Project page: https://yuliang.vision/video-data-aug