听以提取:基于 onset提示的目标说话人提取
音频与语音处理
2025-11-06 v2 声音
摘要
我们提出listen to extract(LExt),一种高度有效且极其简单的数字语音目标说话人提取(TSE)算法。给定目标说话人的enrollment utterance,LExt旨在从包含其他说话人的说话人混合语中提取目标说话人。对于每个混合信号,LExt将目标说话人的enrollment utterance在波形水平上拼接到混合信号中,并训练深度神经网络(DNN)以基于拼接后的混合信号提取目标语音。其理念是:这种方式为目标说话人创建了一个人工语音 onset,可提示DNN(a)需要提取的是哪位说话人;以及(b)目标说话人的谱-时间模式可帮助提取。这种简单方法在多个公共TSE数据集上包括WSJ0-2mix、WHAM!和WHAMR!上产生强大的TSE性能。
引用
@article{arxiv.2505.05114,
title = {Listen to Extract: Onset-Prompted Target Speaker Extraction},
author = {Pengjie Shen and Kangrui Chen and Shulin He and Pengru Chen and Shuqi Yuan and He Kong and Xueliang Zhang and Zhong-Qiu Wang},
journal= {arXiv preprint arXiv:2505.05114},
year = {2025}
}
备注
in IEEE Transactions on Audio, Speech and Language Processing