中文

通过结构化预测自动测量元音时长

机器学习 2017-03-08 v1 机器学习 声音

摘要

使语音学研究具备可扩展性与可重复性的一个关键障碍在于需要依赖主观的手工标注。为应对这一挑战,本文开发了一种机器学习算法,用于自动测量一项广泛使用的语音学指标:元音时长。手工标注数据被用于训练一个模型,该模型以包含单个元音且前后由辅音相隔的任意长度声学信号片段作为输入,并输出该元音的时长。该模型基于结构化预测框架。输入信号与一组假设的元音起始点和结束点通过一组声学特征函数被映射到一个抽象向量空间中。学习算法在该空间内训练,以最小化预测元音时长与手工测量元音时长在期望上的差异。训练后的模型无需语音或正字法转录即可自动估计元音时长。将该模型与三组手工标注数据进行比较的结果表明,其表现优于当前时长测量的黄金标准——一个基于 HMM 的强制对齐器(后者需要正字法或语音转录作为输入)。

关键词

引用

@article{arxiv.1610.08166,
  title  = {Automatic measurement of vowel duration via structured prediction},
  author = {Yossi Adi and Joseph Keshet and Emily Cibelli and Erin Gustafson and Cynthia Clopper and Matthew Goldrick},
  journal= {arXiv preprint arXiv:1610.08166},
  year   = {2017}
}