中文

为何用于语音识别的自监督学习有益于说话人识别?

计算与语言 2022-06-28 v2 声音 音频与语音处理

摘要

近年来,自监督学习(SSL)在说话人识别中展现出强大的性能,即使其预训练目标是为语音识别而设计的。在本文中,我们通过一系列精心设计的实验,研究了导致自监督学习在说话人相关任务(例如说话人验证,SV)上取得成功的因素。我们在 Voxceleb-1 数据集上的实证结果表明,SSL 对 SV 任务的益处来自于掩码语音预测损失、数据规模和模型大小的组合,而 SSL 量化器的影响较小。我们进一步采用积分梯度归因方法和损失景观可视化来理解自监督学习对说话人识别性能的有效性。

关键词

引用

@article{arxiv.2204.12765,
  title  = {Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?},
  author = {Sanyuan Chen and Yu Wu and Chengyi Wang and Shujie Liu and Zhuo Chen and Peidong Wang and Gang Liu and Jinyu Li and Jian Wu and Xiangzhan Yu and Furu Wei},
  journal= {arXiv preprint arXiv:2204.12765},
  year   = {2022}
}

备注

Accepted by INTERSPEECH 2022