利用纯音频数据进行文本查询的目标声音提取
音频与语音处理
2024-09-23 v1 声音
摘要
文本查询目标声音提取(TSE)的目标是从混合声音中提取出由自然语言字幕指定的声源。虽然获取大规模文本-音频对以应对各种文本提示是首选,但可用的高质量文本-音频对数量有限,阻碍了数据规模的扩展。为此,本研究探讨了如何利用没有任何字幕的纯音频数据进行文本查询 TSE 任务,以潜在地扩大数据量。一种直接的方法是使用联合音频-文本嵌入模型,如对比语言-音频预训练(CLAP)模型,作为查询编码器,并使用从真实音频获得的音频嵌入来训练 TSE 模型。然后,TSE 模型可以在推理时通过切换到文本编码器来接受文本查询。虽然如果 CLAP 中的音频和文本嵌入空间良好对齐,这种方法应该可行,但在实践中,嵌入包含特定领域的信息,导致 TSE 模型对音频查询过拟合。我们研究了几种避免过拟合的方法,并表明诸如 dropout 之类的简单嵌入操作方法可以有效缓解此问题。大量实验表明,在训练期间使用带有嵌入 dropout 的纯音频数据与使用文本字幕一样有效,并且纯音频数据可以被有效利用以改进文本查询 TSE 模型。
引用
@article{arxiv.2409.13152,
title = {Leveraging Audio-Only Data for Text-Queried Target Sound Extraction},
author = {Kohei Saijo and Janek Ebbers and François G. Germain and Sameer Khurana and Gordon Wichern and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2409.13152},
year = {2024}
}
备注
Submitted to ICASSP 2025