中文

CLIPSep:利用含噪无标注视频学习文本查询的声音分离

声音 2023-03-07 v2 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

近年来,声音分离已从针对语音或音乐的特定领域分离,进展到针对任意声音的通用声音分离。先前关于通用声音分离的研究探讨了给定文本查询从音频混合中分离目标声音。此类文本查询声音分离系统为指定任意目标声音提供了自然且可扩展的接口。然而,有监督的文本查询声音分离系统需要昂贵的标注音频-文本对用于训练。此外,现有数据集中提供的音频常在受控环境中录制,导致与真实场景中含噪音频存在显著的泛化差距。本工作中,我们旨在仅使用无标注数据来逼近文本查询的通用声音分离。我们提出利用视觉模态作为桥梁来学习所需的音频-文本对应。所提出的 CLIPSep 模型首先使用对比语言-图像预训练(CLIP)模型将输入查询编码为查询向量,随后该查询向量用于调节音频分离模型以分离出目标声音。尽管模型在从无标注视频中提取的图像-音频对上训练,由于 CLIP 模型学习的联合语言-图像嵌入,在测试时我们可以以零样本设置用文本输入查询模型。此外,真实场景视频常包含画外音和背景噪声,可能阻碍模型学习所需的音频-文本对应。为解决此问题,我们进一步提出一种称为噪声不变训练的方法,用于在含噪数据上训练基于查询的声音分离模型。实验结果表明,所提模型仅使用含噪无标注视频即成功学习了文本查询的通用声音分离,在某些设置下甚至取得与有监督模型相竞争的性能。

关键词

引用

@article{arxiv.2212.07065,
  title  = {CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos},
  author = {Hao-Wen Dong and Naoya Takahashi and Yuki Mitsufuji and Julian McAuley and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2212.07065},
  year   = {2023}
}

备注

Accepted by ICLR 2023. Audio samples can be found at https://sony.github.io/CLIPSep/