中文

序列对比视听学习

声音 2025-03-18 v2 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

对比学习已成为视听表示学习中的一项强大技术,它利用了网络规模视频数据集中音频和视觉模态的自然共现。然而,传统的对比视听学习(CAV)方法通常依赖于通过时间聚合获得的聚合表示,忽略了数据固有的序列性质。这种疏忽引发了关于标准方法捕获和利用序列中细粒度信息能力的担忧。针对这一局限性,我们提出了序列对比视听学习(SCAV),该方法使用多维序列距离,基于非聚合表示空间对示例进行对比。使用VGGSound和Music数据集进行的视听检索实验证明了SCAV的有效性,与传统的基于聚合的对比学习以及其他先前提出的使用更多参数和数据的方法相比,召回率相对提高了高达3.5倍。我们还表明,使用SCAV训练的模型在检索所采用的度量方面表现出显著的灵活性,使我们能够采用既有效又高效的混合检索方法。

关键词

引用

@article{arxiv.2407.05782,
  title  = {Sequential Contrastive Audio-Visual Learning},
  author = {Ioannis Tsiamas and Santiago Pascual and Chunghsin Yeh and Joan Serrà},
  journal= {arXiv preprint arXiv:2407.05782},
  year   = {2025}
}

备注

ICASSP 2025. Version 1 contains more details