中文

面向自动说话人确认的大规模自监督语音表征学习

声音 2022-01-25 v2 音频与语音处理

摘要

从大规模无标注数据中学得的语音表征比有监督学习所得更具泛化性,因而被大量应用于各类下游任务。本文中,我们探索不同自监督目标与数据集所学语音表征用于自动说话人确认(ASV)的极限,尤其以广受认可的 SOTA ASV 模型 ECAPA-TDNN [1] 作为下游模型。预训练模型所有隐藏层的表征先以可学习权重平均,再作为输入特征送入 ECAPA-TDNN。在 Voxceleb 数据集上的实验表明,加权平均表征显著优于 FBank——一种传统的 ASV 手工特征。我们最佳单系统分别在 VoxCeleb1 的三个官方评测集上取得 0.537%、0.569% 与 1.180% 的等错误率(EER)。相应地,三个预训练模型集成的系统可进一步将 EER 提升至 0.479%、0.536% 与 1.023%。在三项评测中,我们最佳系统在 VoxCeleb1-E 评测上优于 VoxCeleb 说话人识别挑战赛 2021(VoxSRC2021)的冠军系统 [2]。

关键词

引用

@article{arxiv.2110.05777,
  title  = {Large-scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification},
  author = {Zhengyang Chen and Sanyuan Chen and Yu Wu and Yao Qian and Chengyi Wang and Shujie Liu and Yanmin Qian and Michael Zeng},
  journal= {arXiv preprint arXiv:2110.05777},
  year   = {2022}
}

备注

Accepted by ICASSP 2022