如何利用基于 DNN 的语音增强进行多通道说话人验证?
声音
2022-10-18 v1 人机交互
音频与语音处理
摘要
由于环境噪声和房间混响的不利影响,说话人验证(SV)在远场场景下性能不佳。本工作提出了一种面向远场说话人验证的多通道语音增强基准。一种方法基于深度神经网络,另一种将深度神经网络与信号处理相结合。我们将 DNN 架构与信号处理技术集成以开展多种实验。我们的方法并与现有最先进方法进行比较。我们考察了注册阶段预处理的重要性,而这一点在以往研究中被严重忽视。实验评估表明,只要注册文件以与测试数据类似的方式处理,且测试与注册发生在相似的 SNR 范围内,预处理即可提升 SV 性能。在 VOiCES 数据集的生成及所有噪声条件下均获得了显著改进。
引用
@article{arxiv.2210.08834,
title = {How to Leverage DNN-based speech enhancement for multi-channel speaker verification?},
author = {Sandipana Dowerah and Romain Serizel and Denis Jouvet and Mohammad Mohammadamini and Driss Matrouf},
journal= {arXiv preprint arXiv:2210.08834},
year = {2022}
}