中文

具有时间自监督的视听对比学习

计算机视觉与模式识别 2023-02-16 v1

摘要

我们提出一种用于视频的自监督学习方法,可在无人工监督下学习RGB帧及伴随音频的表示。与捕捉静态场景外观的图像不同,视频还包含声音和时序场景动态。为利用视频固有的时间维度和听觉维度,我们的方法将时间自监督扩展到视听场景,并将其与多模态对比目标相整合。作为时间自监督,我们在两种模态中提出回放速度与方向识别,并设计了模态内与模态间的时间排序任务。此外,我们设计了一种新颖的对比目标,其中常规配对补充了从演化特征空间中采样的额外样本依赖正样本与负样本。在我们的模型中,我们在视频片段之间以及视频与其时间对应的音频片段之间应用此类损失。我们在广泛的消融实验中验证了模型设计,并在迁移实验中评估了视频与音频表示:在UCF101和HMBD51上的动作识别与检索、ESC50上的音频分类、VGG-Sound上的鲁棒视频指纹识别,均取得了最先进的结果。

关键词

引用

@article{arxiv.2302.07702,
  title  = {Audio-Visual Contrastive Learning with Temporal Self-Supervision},
  author = {Simon Jenni and Alexander Black and John Collomosse},
  journal= {arXiv preprint arXiv:2302.07702},
  year   = {2023}
}

备注

AAAI-23