时空增强对自监督视听表征学习的影响
计算机视觉与模式识别
2021-10-15 v1
摘要
听觉与视觉感知的对比学习在各自独立研究时已极为成功。然而,如何整合从两个领域中学到的原理以获得有效的视听表征,仍存在重大疑问。本文提出一种对比框架,从未标注视频中学习视听表征。自监督预训练中所用增强的类型与强度,是对比框架能否充分工作的关键因素。因此,我们深入探究适用于学习视听表征的时间增强的组合;我们发现,不破坏视频时间一致性的有损时空变换最为有效。此外,我们表明这些变换的有效性随更高时间分辨率和更强变换强度而提升。与仅在基于采样的时序增强上预训练的自监督模型相比,采用我们所提时间增强预训练的自监督模型在 AVE 数据集上的线性分类器性能提升约 6.5%。最后,我们表明尽管简单,我们所提变换在多种自监督学习框架(SimSiam、MoCoV3 等)与视听基准数据集(AVE)上均表现良好。
引用
@article{arxiv.2110.07082,
title = {The Impact of Spatiotemporal Augmentations on Self-Supervised Audiovisual Representation Learning},
author = {Haider Al-Tahan and Yalda Mohsenzadeh},
journal= {arXiv preprint arXiv:2110.07082},
year = {2021}
}