基于简单孪生网络与自监督正则化的自监督说话人验证
音频与语音处理
2022-02-03 v2 机器学习
声音
摘要
在无说话人标签的情况下训练具有说话人区分性和鲁棒性的说话人验证系统仍然具有挑战性且值得探索。在本研究中,我们提出了一种有效的自监督学习框架和一种新颖的正则化策略,以促进自监督说话人表征学习。与基于对比学习的自监督学习方法不同,所提出的自监督正则化 (SSReg) 仅关注正数据对潜在表征之间的相似性。我们还探索了在时域和频域上替代在线数据增强策略的有效性。凭借我们强大的在线数据增强策略,所提出的 SSReg 展示了在不使用负样本对的情况下进行自监督学习的潜力,并且它可以通过简单的孪生网络架构显著提高自监督说话人表征学习的性能。在 VoxCeleb 数据集上的综合实验表明,我们提出的自监督方法通过添加有效的自监督正则化,获得了 23.4% 的相对改进,并优于其他先前的工作。
引用
@article{arxiv.2112.04459,
title = {Self-Supervised Speaker Verification with Simple Siamese Network and Self-Supervised Regularization},
author = {Mufan Sang and Haoqi Li and Fang Liu and Andrew O. Arnold and Li Wan},
journal= {arXiv preprint arXiv:2112.04459},
year = {2022}
}
备注
Accepted to ICASSP 2022