基于簇感知 DINO 的自监督学习用于高性能鲁棒说话人验证
声音
2023-04-13 v1 音频与语音处理
摘要
自动说话人验证任务利用深度学习方法与大规模人工标注数据集已取得巨大成就。然而,收集大量良标注数据用于系统构建非常困难且昂贵。本文中,我们提出一种新颖先进的自监督学习框架,其可在不使用任何标注数据的情况下构建高性能说话人验证系统。为避免假负样本对的影响,我们采用无标签自蒸馏(DINO)框架作为初始模型,其可在不利用负样本对的情况下训练。随后,我们为 DINO 引入簇感知训练策略以提升数据多样性。在迭代学习阶段,由于聚类产生大量不可靠标签,伪标签质量对系统训练至关重要。这促使我们提出动态损失门与标签纠正(DLG-LC)方法,以缓解不可靠标签引起的性能退化。更具体地,我们用 GMM 对损失分布建模并动态获得损失门阈值以区分可靠与不可靠标签。此外,我们采用模型预测纠正不可靠标签,以更好利用不可靠数据而非直接丢弃。而且,我们将 DLG-LC 扩展至多模态以进一步提升性能。实验在常用 Voxceleb 数据集上进行。相较于已知最佳自监督说话人验证系统,我们所提方法在 Vox-O、Vox-E 和 Vox-H 测试集上取得 22.17%、27.94% 和 25.56% 的相对 EER 提升,即便迭代更少、模型更小且聚类方法更简单。更重要的是,新提系统甚至取得与全监督系统相当的结果,却未使用任何人工标注数据。
引用
@article{arxiv.2304.05754,
title = {Self-Supervised Learning with Cluster-Aware-DINO for High-Performance Robust Speaker Verification},
author = {Bing Han and Zhengyang Chen and Yanmin Qian},
journal= {arXiv preprint arXiv:2304.05754},
year = {2023}
}
备注
Submitted to TASLP in July 19, 2022