中文

更多语音还是更多说话人?

机器学习 2023-03-03 v2 声音 音频与语音处理

摘要

自训练(ST)与自监督学习(SSL)方法已在自动语音识别(ASR)中展现出强劲的性能提升。尽管取得了这些进展,但据我们所知,尚未有分析研究这些方法中所用标注与未标注数据集的构成如何影响结果。本文旨在分析训练数据中说话人数量对近期SSL算法(wav2vec 2.0)与近期ST算法(slimIPL)的影响。我们通过固定时长改变说话人数量及其反操作,对标注与未标注数据进行了系统性分析。我们的发现表明,SSL需要大量未标注数据以产生高精度结果,而ST则需要标注数据中有足够数量的说话人,尤其在低资源设定下。由此,这两种方法在不同数据构成 regime 下分别改进了监督学习。

关键词

引用

@article{arxiv.2211.00854,
  title  = {More Speaking or More Speakers?},
  author = {Dan Berrebbi and Ronan Collobert and Navdeep Jaitly and Tatiana Likhomanenko},
  journal= {arXiv preprint arXiv:2211.00854},
  year   = {2023}
}

备注

ICASSP 2023