中文

分离你所描述的:基于语言查询的音频源分离

音频与语音处理 2022-03-30 v1 人工智能 计算与语言 声音 信号处理

摘要

本文提出语言查询音频源分离(LASS)任务,旨在基于目标声源的自然语言查询(如“一名男子讲笑话后众人大笑”)从音频混合中分离出目标声源。LASS 的一个独特挑战在于自然语言描述的复杂性及其与音频源的关系。针对该问题,我们提出 LASS-Net,一种端到端神经网络,经学习可联合处理声学与语言信息,并从音频混合中分离出与语言查询一致的目标声源。我们使用基于 AudioCaps 数据集构建的数据集评估所提系统的性能。实验结果表明,LASS-Net 相较基线方法取得了显著改进。此外,我们观察到当使用多样化的人标描述作为查询时,LASS-Net 取得了有前景的泛化结果,表明其在真实场景中的潜在用途。分离音频样本与源代码见 https://liuxubo717.github.io/LASS-demopage。

关键词

引用

@article{arxiv.2203.15147,
  title  = {Separate What You Describe: Language-Queried Audio Source Separation},
  author = {Xubo Liu and Haohe Liu and Qiuqiang Kong and Xinhao Mei and Jinzheng Zhao and Qiushi Huang and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2203.15147},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022, 5 pages, 3 figures