自蒸馏原型网络:无监督学习鲁棒说话人表征
音频与语音处理
2024-12-30 v6 声音
摘要
在无显式说话人标签的情况下训练具有说话人判别性且鲁棒的说话人验证系统仍是一项持续挑战。本文提出一种新颖的自监督说话人验证方法——自蒸馏原型网络(Self-Distillation Prototypes Network, SDPN),其有效促进了自监督说话人表征学习。SDPN 将一条话语增强视图的表征分配给与原视图表征相同的原型,从而在增强视图与原视图之间实现有效的知识迁移。由于 SDPN 训练过程中缺乏负对,网络倾向于在嵌入空间中将正对对齐得相当紧密,此现象称为模型坍塌。为缓解该问题,我们在 SDPN 中引入对嵌入的多样性正则项。在 VoxCeleb 数据集上的综合实验证明了 SDPN 在自监督说话人验证方法中的优越性。SDPN 在 VoxCeleb1 说话人验证评测基准上确立了新的 SOTA,在 VoxCeleb1-O、VoxCeleb1-E 和 VoxCeleb1-H 试集上分别取得等错误率 1.80%、1.99% 和 3.62%,且训练未使用任何说话人标签。消融研究表明,所提自蒸馏网络中的可学习原型与多样性正则均有助于验证性能。
引用
@article{arxiv.2308.02774,
title = {Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision},
author = {Yafeng Chen and Siqi Zheng and Hui Wang and Luyao Cheng and Qian Chen and Chong Deng and Shiliang Zhang and Wen Wang},
journal= {arXiv preprint arXiv:2308.02774},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2211.04168