面向远场说话人验证的基于虚拟信道线性预测的语音去混响前端任务特定优化
音频与语音处理
2021-12-28 v1
摘要
在含噪远场说话场景下,为鲁棒自动说话人验证(ASV)开发单麦克风语音去噪或去混响前端具有挑战性。为解决该问题,我们提出了一种新颖的前端设计,其包含近期提出的加权预测误差(WPE)语音去混响算法的扩展——虚拟声学信道扩展(VACE)-WPE。本研究的实验表明,与传统WPE算法不同,VACE-WPE可被显式训练以抵消晚期混响与背景噪声。为构建前端,首先独立(预)训练VACE-WPE以产生“含噪”去混响信号;随后,给定预训练的说话人嵌入模型,在任务特定优化(TSO)框架内对VACE-WPE进一步微调,使从处理后信号提取的说话人嵌入与从“无噪”目标信号提取的说话人嵌入相似。此外,为将所提前端扩展至受控远场条件之外更通用的无约束“真实环境”ASV场景,我们提出了一种TSO框架内VACE-WPE的失真正则化方法。所提方法的有效性在远场与真实环境ASV基准上均得到验证,表明其在多种情况下优于全神经前端与其他TSO方法。
引用
@article{arxiv.2112.13569,
title = {Task-specific Optimization of Virtual Channel Linear Prediction-based Speech Dereverberation Front-End for Far-Field Speaker Verification},
author = {Joon-Young Yang and Joon-Hyuk Chang},
journal= {arXiv preprint arXiv:2112.13569},
year = {2021}
}