面向噪声环境下说话人确认的扩展 U-Net
音频与语音处理
2022-06-28 v1 声音
摘要
背景噪声会因模糊语音可懂度而降低说话人确认(SV)系统的准确性与可靠性,这是一个众所周知的因素。已有多种研究在噪声环境下使用独立的预训练增强模型作为 SV 系统的前端模块,这些方法能有效去除噪声。然而,未针对 SV 任务定制的独立增强模型的去噪过程也可能扭曲语句中所包含的说话人信息。我们认为,在噪声条件下为 SV 任务应将增强网络与说话人嵌入提取器进行充分的联合训练以缓解此问题。因此,我们提出了一种基于 U-Net 的集成框架,可同时优化说话人识别损失与特征增强损失。此外,我们分析了直接将 U-Net 用于噪声 SV 任务的结构性局限,并进一步提出扩展 U-Net 以减少这些缺陷。我们在噪声合成的 VoxCeleb1 测试集与多种噪声场景下录制的 VOiCES 开发集上评估了模型。实验结果表明,基于 U-Net 的充分联合训练框架比基线更有效,且扩展 U-Net 相对于近期提出的补偿系统展现出最先进的性能。
引用
@article{arxiv.2206.13044,
title = {Extended U-Net for Speaker Verification in Noisy Environments},
author = {Ju-ho Kim and Jungwoo Heo and Hye-jin Shim and Ha-Jin Yu},
journal= {arXiv preprint arXiv:2206.13044},
year = {2022}
}
备注
5 pages, 2 figures, 4 tables, accepted to 2022 Interspeech as a conference paper