非对称干净片段引导的自监督学习用于鲁棒说话人验证
音频与语音处理
2024-03-12 v2
摘要
用于说话人验证(SV)的对比自监督学习(CSL)因能利用无标签数据而近期受到越来越多关注。对原始波形进行数据增强(如加噪或加混响)在 SV 中取得理想结果方面起关键作用。然而,数据增强需要精细校准以确保说话人特有信息完好,这在没有说话人标签时难以实现。为解决此问题,我们引入一种新框架,将干净片段与增强片段纳入对比训练流程。干净片段被重新利用,与含噪片段配对以形成额外的正样本对与负样本对。此外,对比损失被加权以增大不同说话人的干净与增强嵌入之间的差异。在 Voxceleb1 上的实验结果表明,所提框架相较常规方法可实现显著的 19% 提升,并超越许多现有最先进(state-of-the-art)技术。
引用
@article{arxiv.2309.04265,
title = {Asymmetric Clean Segments-Guided Self-Supervised Learning for Robust Speaker Verification},
author = {Chong-Xin Gan and Man-Wai Mak and Weiwei Lin and Jen-Tzung Chien},
journal= {arXiv preprint arXiv:2309.04265},
year = {2024}
}
备注
5 pages, 2 figures, accepted by ICASSP 2024