中文

语速勿快:数据偏差对自监督语音模型的影响

音频与语音处理 2022-04-27 v3 计算与语言 声音

摘要

自监督语音模型(S3Ms)已在许多语音下游任务(如自动语音识别)中被证明是成功的。然而,预训练数据如何影响S3Ms的下游行为仍是一个未被探索的问题。本文通过在不同因素(包括性别、内容和韵律)的偏差数据集上预训练模型,并评估这些预训练S3Ms在SUPERB基准测试中选定的下游任务上的表现,来研究预训练数据如何影响S3Ms。我们的实验表明,S3Ms对性别偏差具有容忍度。此外,我们发现语音内容对S3Ms在各下游任务上的性能影响甚微,但S3Ms确实表现出对较慢语速的偏好。

关键词

引用

@article{arxiv.2110.07957,
  title  = {Don't speak too fast: The impact of data bias on self-supervised speech models},
  author = {Yen Meng and Yi-Hui Chou and Andy T. Liu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2110.07957},
  year   = {2022}
}

备注

Accepted by ICASSP 2022