基于 UNet 的融合与指数移动平均自适应用于抗噪鲁棒说话人识别
音频与语音处理
2026-04-29 v1
摘要
在噪声声学环境下,用于说话人识别的语音增强与说话人嵌入网络的联合训练被广泛采用。虽然有效,但该范式通常未能利用大规模语音增强预训练固有的泛化与鲁棒性优势。此外,在去噪语音中保持说话人信息并非语音增强过程的显式目标。为了解决这些局限性,我们提出了一种可扩展的基于 UNet 的融合框架(UF-EMA),该框架将含噪语音与增强语音视为多通道输入,从而使说话人编码器能够有效利用说话人信息。此外,将指数移动平均策略应用于在纯净语音上预训练的说话人编码器,以缓解过拟合并促进从纯净到含噪条件的平滑过渡。在多个含噪测试集上的实验结果展示了所提方法的优越性。
引用
@article{arxiv.2604.25624,
title = {UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition},
author = {Chong-Xin Gan and Peter Bell and Man-Wai Mak and Zhe Li and Zezhong Jin and Zilong Huang and Kong Aik Lee},
journal= {arXiv preprint arXiv:2604.25624},
year = {2026}
}
备注
Submitted to Interspeech 2026