面向鲁棒说话人验证的目标说话人增强方法
音频与语音处理
2021-03-17 v1
摘要
本文提出基于目标说话人增强的说话人验证网络(TASE-SVNet),这是一种将目标说话人增强与说话人嵌入提取相耦合的全神经网络模型,用于鲁棒说话人验证(SV)。具体而言,采用以注册说话人为条件的语音增强模块作为前端,从与目标说话人混合的干扰说话人和环境噪声中提取目标说话人。与传统的目标说话人增强模型相比,非目标说话人/干扰抑制在 SV 中应受到额外关注。因此,我们探索了一种有效的非目标说话人采样策略。为以轻量模型提升说话人嵌入提取能力,提出了一种教师-学生(T/S)训练,将说话人判别信息从大模型蒸馏至小模型。我们研究了迭代推断以解决含噪说话人注册问题。我们在两项 SV 任务上评估所提方法,其一为高度重叠语音,其二为车载环境中含多种噪声类型。实验表明,相较于 SOTA 基线,等错误率(EER)取得了显著且一致的提升。
引用
@article{arxiv.2103.08781,
title = {Towards Robust Speaker Verification with Target Speaker Enhancement},
author = {Chunlei Zhang and Meng Yu and Chao Weng and Dong Yu},
journal= {arXiv preprint arXiv:2103.08781},
year = {2021}
}
备注
Accepted by IEEE ICASSP 2021