中文

面向国际音标的通用自动语音音素转写

计算与语言 2023-08-09 v1 声音 音频与语音处理

摘要

本文提出了一种最先进的模型,用于将任意语言的语音转写为国际音标(IPA)。将口语转写为IPA是语言记录中必不可少但耗时的过程,即便部分自动化该过程也有潜力大幅加速濒危语言的记录。与先前最佳的语音到IPA模型(Wav2Vec2Phoneme)类似,我们的模型基于wav2vec 2.0,并经过微调以从音频输入预测IPA。我们使用来自CommonVoice 11.0的七种语言的训练数据,以半自动方式转写为IPA。尽管该训练数据集远小于Wav2Vec2Phoneme的,但其更高质量使我们的模型取得了相当或更好的结果。此外,我们表明我们的通用语音到IPA模型的质量接近于人类标注者。

关键词

引用

@article{arxiv.2308.03917,
  title  = {Universal Automatic Phonetic Transcription into the International Phonetic Alphabet},
  author = {Chihiro Taguchi and Yusuke Sakai and Parisa Haghani and David Chiang},
  journal= {arXiv preprint arXiv:2308.03917},
  year   = {2023}
}

备注

5 pages, 7 tables