中文

用于自监督说话人验证的自举均衡与概率说话人表征学习

音频与语音处理 2021-12-28 v2 人工智能 机器学习 声音

摘要

本文提出自监督说话人表征学习策略,包括前端自举均衡说话人表征学习与后端不确定性感知概率说话人嵌入训练。在前端阶段,我们通过带有均匀性正则化项的自举训练方案学习说话人表征。在后端阶段,通过最大化属于同一说话人的语音样本之间的互似然分数来估计概率说话人嵌入,其不仅提供说话人表征,还提供数据不确定性。实验结果表明,所提出的自举均衡训练策略能有效帮助学习说话人表征,并优于基于对比学习的传统方法。此外,我们证明集成的前端-后端两阶段框架在 VoxCeleb1 测试集上进一步提升了说话人验证性能(以 EER 和 MinDCF 衡量)。

关键词

引用

@article{arxiv.2112.08929,
  title  = {Bootstrap Equilibrium and Probabilistic Speaker Representation Learning for Self-supervised Speaker Verification},
  author = {Sung Hwan Mun and Min Hyun Han and Dongjune Lee and Jihwan Kim and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2112.08929},
  year   = {2021}
}

备注

Accepted by IEEE Access