中文

基于噪声词边界微调 XLS-R 的无监督语音词分割

计算与语言 2023-10-10 v1 声音 音频与语音处理

摘要

由于语音流中缺乏显式词边界,在无文本监督下将口语句子分割为词单元的任务尤为困难。本工作中,我们利用最新的自监督语音模型,其已证明可通过微调快速适应新任务,即便在低资源条件下亦如此。受半监督学习启发,我们微调 XLS-R 模型以预测由顶级语音分割系统 DPDP、VG-HuBERT、GradSeg 与 DP-Parse 生成的词边界本身。一旦 XLS-R 微调完成,便用于推断新的词边界标签,这些标签转而用于另一次微调步骤。我们的方法持续提升各系统的性能,并确立了新的 SOTA,在五个不同语言语料库上以正确发现的词符的 F1 分数衡量,平均比先前方法高 130%。最后,我们的系统能以零样本方式分割微调期间未见过的语言语音。

关键词

引用

@article{arxiv.2310.05235,
  title  = {XLS-R fine-tuning on noisy word boundaries for unsupervised speech segmentation into words},
  author = {Robin Algayres and Pablo Diego-Simon and Benoit Sagot and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2310.05235},
  year   = {2023}
}

备注

Findings at EMNLP 2023