中文

面向深度说话人嵌入的聚类引导无监督域自适应方法

机器学习 2023-06-21 v1 声音 音频与语音处理

摘要

近期研究表明伪标签有助于说话人验证的无监督域自适应(UDA)。受使用现有分类器标注无标签数据以重新训练的自训练策略启发,我们提出了一种聚类引导的UDA框架,通过聚类标注目标域数据,并将带标签的源域数据与伪标签目标域数据结合训练说话人嵌入网络。为提升聚类质量,我们通过最小化对比中心损失训练专用于聚类的说话人嵌入网络,目标是缩小嵌入与其指派聚类中心的距离,同时增大该嵌入与其他聚类中心的距离。以VoxCeleb2为源域、CN-Celeb1为目标域,我们证明所提方法在CN-Celeb1评测集上无需使用目标域任何标签即可取得8.10%的等错误率(EER),该结果优于有监督基线39.6%,且为该语料上最先进的UDA性能。

关键词

引用

@article{arxiv.2303.15944,
  title  = {Cluster-Guided Unsupervised Domain Adaptation for Deep Speaker Embedding},
  author = {Haiquan Mao and Feng Hong and Man-wai Mak},
  journal= {arXiv preprint arXiv:2303.15944},
  year   = {2023}
}