中文

基于自监督语音模型的 ASR 无监督微调数据选择

音频与语音处理 2022-12-06 v1 计算与语言 声音

摘要

当仅能获取少量转写语音数据时,自监督学习(SSL)已能利用无标签数据提升自动语音识别(ASR)模型的性能。然而,这引发了应选择可用无标签数据中哪一子集进行转写的问题。我们的工作研究了在有限转写预算下微调 HuBERT 模型的不同无监督数据选择技术。我们考察了说话人多样性、性别偏差与话题多样性对下游 ASR 性能的影响。我们还设计了两种新颖的无监督数据选择技术:基于预训练损失的数据选择,以及字节对编码聚类单元的困惑度(PBPE),并展示了这些技术与纯随机数据选择相比的效果。最后,我们分析了所选微调子集的固有特征之间的相关性,以及这些特征如何与最终词错误率相关。我们证明了在 WER 方面取得最佳性能时,词元多样性、说话人多样性与话题多样性的重要性。

关键词

引用

@article{arxiv.2212.01661,
  title  = {Unsupervised Fine-Tuning Data Selection for ASR Using Self-Supervised Speech Models},
  author = {Reem Gody and David Harwath},
  journal= {arXiv preprint arXiv:2212.01661},
  year   = {2022}
}