中文

基于 wav2vec2.0 的塞音实现自动分类

计算与语言 2025-06-02 v2 声音 音频与语音处理

摘要

现代语音学研究经常使用自动工具对语音数据进行标注,但针对许多可变语音现象的标注工具寥寥无几。同时,已有研究表明,诸如 wav2vec2.0 之类的预训练自监督模型在语音分类任务中表现优异,并能隐式编码细粒度的语音信息。我们证明,可以训练 wav2vec2.0 模型以高精度自动分类英语和日语中的塞音爆破存在与否,且在精心整理和未准备的语音语料库中均具有鲁棒性。自动标注复现了塞音实现中的变异性模式,并与人工标注的模式高度吻合。这些结果展示了预训练语音模型作为语音语料数据自动标注与处理工具的潜力,使研究人员能够相对轻松地“扩大”语音研究的范围。

关键词

引用

@article{arxiv.2505.23688,
  title  = {Automatic classification of stop realisation with wav2vec2.0},
  author = {James Tanner and Morgan Sonderegger and Jane Stuart-Smith and Jeff Mielke and Tyler Kendall},
  journal= {arXiv preprint arXiv:2505.23688},
  year   = {2025}
}

备注

Accepted for Interspeech 2025. 5 pages, 3 figures