中文

非对称干净片段引导的自监督学习用于鲁棒说话人验证

音频与语音处理 2024-03-12 v2

摘要

用于说话人验证(SV)的对比自监督学习(CSL)因能利用无标签数据而近期受到越来越多关注。对原始波形进行数据增强(如加噪或加混响)在 SV 中取得理想结果方面起关键作用。然而,数据增强需要精细校准以确保说话人特有信息完好,这在没有说话人标签时难以实现。为解决此问题,我们引入一种新框架,将干净片段与增强片段纳入对比训练流程。干净片段被重新利用,与含噪片段配对以形成额外的正样本对与负样本对。此外,对比损失被加权以增大不同说话人的干净与增强嵌入之间的差异。在 Voxceleb1 上的实验结果表明,所提框架相较常规方法可实现显著的 19% 提升,并超越许多现有最先进(state-of-the-art)技术。

关键词

引用

@article{arxiv.2309.04265,
  title  = {Asymmetric Clean Segments-Guided Self-Supervised Learning for Robust Speaker Verification},
  author = {Chong-Xin Gan and Man-Wai Mak and Weiwei Lin and Jen-Tzung Chien},
  journal= {arXiv preprint arXiv:2309.04265},
  year   = {2024}
}

备注

5 pages, 2 figures, accepted by ICASSP 2024