中文

基于三模态一致性的语言引导音视频源分离

计算机视觉与模式识别 2023-09-26 v2 人工智能 计算与语言

摘要

我们提出了一种自监督方法,用于学习基于自然语言查询在视频中进行音频源分离,仅使用未标注的视频与音频对作为训练数据。该任务的一个关键挑战在于:在训练过程中无标注可用的情况下,学习将发声物体的语言描述与其视觉特征及音频波形对应分量相关联。为克服这一挑战,我们适配现成的视觉-语言基础模型,通过两个新颖的损失函数提供伪目标监督,并鼓励音频、视觉与自然语言模态之间更强的对齐。在推理阶段,我们的方法可给定文本、视频与音频输入,或仅给定文本与音频输入来分离声音。我们在三个音视频分离数据集(包括 MUSIC、SOLOS 和 AudioSet)上展示了自监督方法的有效性,尽管训练时未使用物体检测器或文本标签,我们仍优于强监督的 SOTA 方法。

关键词

引用

@article{arxiv.2303.16342,
  title  = {Language-Guided Audio-Visual Source Separation via Trimodal Consistency},
  author = {Reuben Tan and Arijit Ray and Andrea Burns and Bryan A. Plummer and Justin Salamon and Oriol Nieto and Bryan Russell and Kate Saenko},
  journal= {arXiv preprint arXiv:2303.16342},
  year   = {2023}
}

备注

Accepted at CVPR 2023