无需并行训练数据的语言查询目标声音提取
音频与语音处理
2025-03-24 v3 声音
摘要
语言查询目标声音提取旨在基于语言查询从混合声音中提取特定声音。传统的全监督训练方案需要大量标注的并行音频-文本数据,这需要大量人工。我们引入了一种无需并行数据的训练方案,仅需未标注的音频片段,通过利用对比语言-音频预训练模型(CLAP)来训练TSE模型。在原始的无需并行数据的训练阶段,目标音频使用预训练的CLAP音频编码器编码形成条件嵌入,而在测试时,用户语言查询由CLAP文本编码器编码作为条件嵌入。这种原始方法假设文本和音频嵌入之间完美对齐,这是不现实的。训练-测试不匹配带来了两个主要挑战:文本与音频之间持续存在的模态差距,以及训练中目标音频嵌入暴露丰富声学细节导致的过拟合风险。为解决此问题,我们提出了一种检索增强策略。具体来说,我们使用大语言模型生成的音频描述创建一个嵌入缓存。在训练期间,目标音频嵌入从该缓存中检索文本嵌入作为条件嵌入,确保训练和测试之间的模态一致,并消除信息泄露。大量实验结果表明,我们的检索增强方法在现有最先进方法基础上取得了持续且显著的性能提升,并具有更好的泛化能力。
引用
@article{arxiv.2409.09398,
title = {Language-Queried Target Sound Extraction Without Parallel Training Data},
author = {Hao Ma and Zhiyuan Peng and Xu Li and Yukai Li and Mingjie Shao and Qiuqiang Kong and Ju Liu},
journal= {arXiv preprint arXiv:2409.09398},
year = {2025}
}
备注
Accepted by ICASSP 2025