用于视频表征学习的频率选择性增强
计算机视觉与模式识别
2022-12-07 v2
摘要
近期的自监督视频表征学习方法侧重于最大化同一视频多个增强视图之间的相似性,并在很大程度上依赖于所生成视图的质量。然而,大多数现有方法缺乏防止表征学习偏向视频中静态信息的机制。本文中,我们提出频率增强(FreqAug),一种用于视频表征学习的频域时空数据增强方法。FreqAug 随机地从视频中移除特定频率分量,使得学习到的表征为各种下游任务更多地从剩余信息中捕获本质特征。具体而言,FreqAug 通过丢弃空间或时间低频分量,推动模型更关注视频中的动态特征而非静态特征。为验证所提方法的通用性,我们在多种自监督学习框架及标准增强上进行了 FreqAug 实验。将改进后表征迁移到五个视频动作识别和两个时序动作定位下游任务,显示出相对于基线的一致提升。
引用
@article{arxiv.2204.03865,
title = {Frequency Selective Augmentation for Video Representation Learning},
author = {Jinhyung Kim and Taeoh Kim and Minho Shim and Dongyoon Han and Dongyoon Wee and Junmo Kim},
journal= {arXiv preprint arXiv:2204.03865},
year = {2022}
}
备注
AAAI23