用于说话人验证中无监督域适应的原型与实例对比学习
音频与语音处理
2024-10-23 v1 声音
摘要
在一个领域上训练的说话人验证系统在应用于另一个领域时通常会性能下降。为了解决这一挑战,研究人员在无监督域适应场景(其中有一些未标记的目标域数据可用)中通常使用基于特征分布匹配的方法。然而,这些方法通常性能提升有限,并且在各种失配情况下缺乏泛化能力。在本文中,我们提出了原型与实例对比学习(PICL),一种通过双层对比学习进行说话人验证中无监督域适应的新方法。对于原型对比学习,我们通过聚类生成伪标签以创建动态更新的原型表示,将实例与其对应的类或簇原型对齐。对于实例对比学习,我们最小化同一实例的不同视图或增强之间的距离,确保对噪声等变化具有鲁棒性和不变性的表示。这种双层方法提供了高层和低层监督,从而提高了说话人验证模型的泛化能力和鲁棒性。与先前仅在一种情况下评估失配的研究不同,我们在各种数据集上进行了相关探索,并取得了当前最先进的性能,这也证明了我们方法的泛化性。
引用
@article{arxiv.2410.17033,
title = {Prototype and Instance Contrastive Learning for Unsupervised Domain Adaptation in Speaker Verification},
author = {Wen Huang and Bing Han and Zhengyang Chen and Shuai Wang and Yanmin Qian},
journal= {arXiv preprint arXiv:2410.17033},
year = {2024}
}
备注
Accepted to ISCSLP 2024