中文

U-vectors:从无标签数据生成可聚类说话人嵌入

声音 2021-10-25 v2 人工智能 机器学习 音频与语音处理

摘要

说话人识别旨在通过语音识别说话人。大多数说话人识别系统基于两阶段构建,第一阶段从语音中提取低维相关性嵌入,第二阶段执行分类任务。说话人识别系统的鲁棒性主要取决于语音嵌入的提取过程,而嵌入通常在大尺度数据集上预训练。由于嵌入系统经过预训练,说话人识别模型的性能极大依赖于域适应策略,若使用不充分数据训练则可能下降。本文提出一种处理无标签数据的说话人识别策略,其从小的固定尺寸语音帧生成可聚类嵌入向量。该无监督训练策略基于一个假设:一小段语音段应只包含单一说话人。基于此种假设,构建带噪声增强策略的成对约束,用于训练生成说话人嵌入的 AutoEmbedder 架构。不依赖域适应策略,该过程无监督地产生可聚类说话人嵌入,称为无监督向量(u-vectors)。评估在两个流行的英语说话人识别数据集 TIMIT 和 LibriSpeech 上完成。此外,还包含一个孟加拉语数据集以说明说话人识别系统域偏移的多样性。最后,我们得出结论:所提方法利用成对架构取得了令人满意的性能。

关键词

引用

@article{arxiv.2102.03868,
  title  = {U-vectors: Generating clusterable speaker embedding from unlabeled data},
  author = {M. F. Mridha and Abu Quwsar Ohi and Muhammad Mostafa Monowar and Md. Abdul Hamid and Md. Rashedul Islam and Yutaka Watanobe},
  journal= {arXiv preprint arXiv:2102.03868},
  year   = {2021}
}

备注

18 pages, 7 figures