基于噪声词边界微调 XLS-R 的无监督语音词分割
计算与语言
2023-10-10 v1 声音
音频与语音处理
摘要
由于语音流中缺乏显式词边界,在无文本监督下将口语句子分割为词单元的任务尤为困难。本工作中,我们利用最新的自监督语音模型,其已证明可通过微调快速适应新任务,即便在低资源条件下亦如此。受半监督学习启发,我们微调 XLS-R 模型以预测由顶级语音分割系统 DPDP、VG-HuBERT、GradSeg 与 DP-Parse 生成的词边界本身。一旦 XLS-R 微调完成,便用于推断新的词边界标签,这些标签转而用于另一次微调步骤。我们的方法持续提升各系统的性能,并确立了新的 SOTA,在五个不同语言语料库上以正确发现的词符的 F1 分数衡量,平均比先前方法高 130%。最后,我们的系统能以零样本方式分割微调期间未见过的语言语音。
引用
@article{arxiv.2310.05235,
title = {XLS-R fine-tuning on noisy word boundaries for unsupervised speech segmentation into words},
author = {Robin Algayres and Pablo Diego-Simon and Benoit Sagot and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2310.05235},
year = {2023}
}
备注
Findings at EMNLP 2023