中文

音视频数据自监督学习中的正负采样策略

音频与语音处理 2024-02-06 v1

摘要

在自监督学习 (SSL) 中,音视频对应 (AVC) 是一项流行任务,旨在从大规模无标签数据集中学习深度音频和视频特征。AVC 的关键步骤是从数据集中随机采样音频和视频片段,并学习最小化正样本对(对应的音视频对)之间的特征距离,同时最大化负样本对(不对应的音视频对)之间的距离。所学特征已被证明在各种下游任务中有效。然而,当数据集规模较小时,这些方法的性能欠佳。本文研究了在 AVC 特征学习任务中利用类别标签信息的效果。我们基于类别标签信息修改了 SSL 的各种正负数据采样技术,以调查其对特征质量的影响。我们提出了一种新的采样方法,称为软正采样 (soft-positive sampling),其中某个音频样本的正样本对并非来自完全对应的视频,而是来自同一类别的视频。实验结果表明,在 SSL 设置下当数据集规模较小时,通过软正采样方法学到的特征显著优于传统 SSL 采样方法得到的特征。这一趋势在域内和域外下游任务中均成立,甚至优于监督分类。最后,实验表明类别标签信息可以轻松利用公开可用的分类器网络获得,随后可用于提升 SSL 性能,而无需增加额外的数据标注负担。

关键词

引用

@article{arxiv.2402.02899,
  title  = {Positive and negative sampling strategies for self-supervised learning on audio-video data},
  author = {Shanshan Wang and Soumya Tripathy and Toni Heittola and Annamaria Mesaros},
  journal= {arXiv preprint arXiv:2402.02899},
  year   = {2024}
}