利用稀疏 LDA 变换说话人嵌入改进目标说话人提取
声音
2023-01-18 v1 人工智能
机器学习
音频与语音处理
摘要
作为语音分离的一种实用替代方案,目标说话人提取(TSE)旨在利用从说话人提取的额外说话人线索从所需说话人中提取语音。其主要挑战在于如何恰当地提取并利用说话人线索以提升提取语音质量。大多数现有 TSE 研究采用的线索提取方法是直接利用从预训练说话人验证模型中提取的判别性说话人嵌入。尽管高说话人判别性对于说话人验证任务是最理想的属性,我们认为其对 TSE 可能过于复杂。在本研究中,我们提出具有清晰类别可分性的简化说话人线索可能更受 TSE 青睐。为验证我们的提议,我们引入了几种说话人线索形式,包括朴素说话人嵌入(如 x-vector 和 xi-vector)以及由稀疏 LDA 变换产生的新说话人嵌入。通过将这些说话人线索与 SepFormer(一种 SOTA 语音分离模型)集成构建了相应的 TSE 模型。这些 TSE 模型在基准 WSJ0-2mix 数据集上进行了性能检验。实验结果验证了我们的提议的有效性与泛化性,显示出高达 9.9% 的 SI-SDRi 相对提升。此外,凭借 19.4 dB 的 SI-SDRi 和 3.78 的 PESQ,我们最佳的 TSE 系统显著优于当前 SOTA 系统,并提供了迄今在 WSJ0-2mix 上报道的顶级 TSE 结果。
引用
@article{arxiv.2301.06277,
title = {Improving Target Speaker Extraction with Sparse LDA-transformed Speaker Embeddings},
author = {Kai Liu and Xucheng Wan and Ziqing Du and Huan Zhou},
journal= {arXiv preprint arXiv:2301.06277},
year = {2023}
}
备注
ACCEPTED by NCMMSC 2022