中文

Tusom2021:一种来自濒危语言的用于通用音素识别实验的语音转写数据集

计算与语言 2021-04-05 v1 声音 音频与语音处理

摘要

人们对能够以语言无关方式识别音素的ASR系统兴趣日益增长。此外,人们对为低资源及濒危语言构建语言技术也有兴趣。然而,可用于测试此类系统和技术现实数据十分匮乏。本文提出一个公开可用的、含2255条语音(词和短短语)的音素转写语料库,其来自濒危的Tangkhulic语East Tusom(无ISO 639-3代码),一种主要分布于印度的藏缅语变体。由于该数据集以音素而非音位转写,相较于许多更大的(音位转写的)数据集,它更契合通用音素识别系统。本文描述该数据集及制作所用方法。进一步给出最先进通用音素识别系统在该数据集上的基本基准,作为未来实验的基线。

关键词

引用

@article{arxiv.2104.00824,
  title  = {Tusom2021: A Phonetically Transcribed Speech Dataset from an Endangered Language for Universal Phone Recognition Experiments},
  author = {David R. Mortensen and Jordan Picone and Xinjian Li and Kathleen Siminyu},
  journal= {arXiv preprint arXiv:2104.00824},
  year   = {2021}
}

备注

4 pages, 3 figures