中文

用于无监督音视频预训练的速度协同增强

计算机视觉与模式识别 2023-09-26 v1 多媒体 声音 音频与语音处理

摘要

本工作旨在改进无监督音视频预训练。受视觉对比学习中数据增强有效性的启发,我们提出一种新颖的速度协同增强方法,随机改变音频与视频数据的播放速度。尽管简单,该速度协同增强方法具有两个引人注目的特性:(1)它增加了音视频对的多样性并使负对数量翻倍,从而显著增强所学表征;(2)它改变了音视频对之间的严格相关性,但在增强对之间引入了部分关系,我们通过提出的SoftInfoNCE损失对其建模以进一步提升性能。实验结果表明,与原始音视频对比学习相比,所提方法显著改善了所学表征。

关键词

引用

@article{arxiv.2309.13942,
  title  = {Speed Co-Augmentation for Unsupervised Audio-Visual Pre-training},
  author = {Jiangliu Wang and Jianbo Jiao and Yibing Song and Stephen James and Zhan Tong and Chongjian Ge and Pieter Abbeel and Yun-hui Liu},
  journal= {arXiv preprint arXiv:2309.13942},
  year   = {2023}
}

备注

Published at the CVPR 2023 Sight and Sound workshop