中文

Dr.VOT:在自然语音中测量正、负嗓音起始时间

音频与语音处理 2019-10-30 v1 机器学习 声音 机器学习

摘要

嗓音起始时间(VOT)是基础研究与应用医学研究中语音的一项关键测量指标,它是塞音爆破起始与嗓音起始之间的时间间隔。当嗓音起始先于爆破起始时,VOT 为负;若嗓音起始晚于爆破,则为正。在本工作中,我们提出一种深度学习模型,用于在自然语音中准确可靠地测量 VOT。所提出的系统解决了两个关键问题:它能同样好地测量正 VOT 和负 VOT,并且经过训练对标注间的差异具有鲁棒性。我们的方法基于结构化预测框架,其中特征函数定义为 RNN。这些网络学习捕捉信号中的片段变化。结果表明,我们的方法相较当前最先进水平有实质性改进。与以往工作不同,我们的深度且鲁棒的 VOT 标注器 Dr.VOT 能在保持正 VOT 上最先进性能的同时,成功估计负 VOT。这种高性能可泛化到新的语料库而无需进一步重训练。索引词:结构化预测,多任务学习,对抗训练,循环神经网络,序列分割。

关键词

引用

@article{arxiv.1910.13255,
  title  = {Dr.VOT : Measuring Positive and Negative Voice Onset Time in the Wild},
  author = {Yosi Shrem and Matthew Goldrick and Joseph Keshet},
  journal= {arXiv preprint arXiv:1910.13255},
  year   = {2019}
}

备注

interspeech 2019