分离你所描述的:基于语言查询的音频源分离
音频与语音处理
2022-03-30 v1 人工智能
计算与语言
声音
信号处理
摘要
本文提出语言查询音频源分离(LASS)任务,旨在基于目标声源的自然语言查询(如“一名男子讲笑话后众人大笑”)从音频混合中分离出目标声源。LASS 的一个独特挑战在于自然语言描述的复杂性及其与音频源的关系。针对该问题,我们提出 LASS-Net,一种端到端神经网络,经学习可联合处理声学与语言信息,并从音频混合中分离出与语言查询一致的目标声源。我们使用基于 AudioCaps 数据集构建的数据集评估所提系统的性能。实验结果表明,LASS-Net 相较基线方法取得了显著改进。此外,我们观察到当使用多样化的人标描述作为查询时,LASS-Net 取得了有前景的泛化结果,表明其在真实场景中的潜在用途。分离音频样本与源代码见 https://liuxubo717.github.io/LASS-demopage。
引用
@article{arxiv.2203.15147,
title = {Separate What You Describe: Language-Queried Audio Source Separation},
author = {Xubo Liu and Haohe Liu and Qiuqiang Kong and Xinhao Mei and Jinzheng Zhao and Qiushi Huang and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2203.15147},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022, 5 pages, 3 figures