中文

用于源说话人追踪的说话人对比学习

声音 2024-09-17 v1 音频与语音处理

摘要

作为生物特征认证技术的一种,说话人验证系统的安全性至关重要。然而,SV 系统本质上容易受到各种类型的攻击,这些攻击可能会损害其准确性和可靠性。语音转换就是其中一种攻击,它通过改变各种发声特征来修改一个人的语音,使其听起来像另一个人。这对 SV 系统构成了重大威胁。为了应对这一挑战,IEEE SLT2024 的源说话人追踪挑战赛旨在识别被篡改语音信号中的源说话人信息。具体而言,SSTC 侧重于针对语音转换的源说话人验证,以确定两个转换后的语音样本是否源自同一源说话人。在本研究中,我们提出了一种基于说话人对比学习的源说话人追踪方法,以学习转换语音中潜在的源说话人信息。为了学习与源说话人更相关的表示,我们在嵌入提取器的训练过程中采用了说话人对比损失。这种说话人对比损失有助于在若干干扰说话人嵌入中识别出真实的源说话人嵌入,从而使嵌入提取器能够学习转换语音中潜在的源说话人信息。实验表明,我们提出的说话人对比学习系统在挑战赛测试集上实现了 16.788% 的最低 EER,在挑战赛中荣获第一名。

关键词

引用

@article{arxiv.2409.10072,
  title  = {Speaker Contrastive Learning for Source Speaker Tracing},
  author = {Qing Wang and Hongmei Guo and Jian Kang and Mengjie Du and Jie Li and Xiao-Lei Zhang and Lei Xie},
  journal= {arXiv preprint arXiv:2409.10072},
  year   = {2024}
}

备注

7 pages, 2 figures, accepted by SLT