用于说话人识别无监督域自适应的 CORAL++ 算法
音频与语音处理
2022-02-03 v1 声音
摘要
最先进的说话人识别系统使用大量人工标注的训练数据集进行训练。此类训练集通常由多种数据源组成,以增强模型的建模能力。然而,在实际部署中,未见条件几乎不可避免。由于训练与测试数据集之间的统计差异,域失配是现实应用中的常见问题。为缓解域失配导致的性能退化,我们提出了一种新的基于特征的无监督域自适应算法。我们提出的算法是基于著名的相关系数对齐(CORrelation ALignment, CORAL)的进一步优化,因此我们称之为 CORAL++。在 NIST 2019 说话人识别评测(SRE19)上,我们使用 SRE18 CTS 集作为开发集来验证 CORAL++ 的有效性。在典型的 x-vector/PLDA 设置下,CORAL++ 在等错误率(EER)上相对优于 CORAL 达 9.40%。
引用
@article{arxiv.2202.01092,
title = {The CORAL++ Algorithm for Unsupervised Domain Adaptation of Speaker Recogntion},
author = {Rongjin Li and Weibin Zhang and Dongpeng Chen},
journal= {arXiv preprint arXiv:2202.01092},
year = {2022}
}
备注
5 pages, 1 figures. This paper has been accepted to IEEE ICASSP 2022