中文

DeepFry:使用深度神经网络识别 vocal fry

音频与语音处理 2022-06-28 v2 机器学习 声音

摘要

Vocal fry或creaky voice指以不规则声门开启与低音高为特征的嗓音质量。它出现于多种语言中,且在美国英语中普遍,不仅用于标记短语终结,也用于社会语言学因素与情感。由于其不规则周期性,creaky voice对自动语音处理与识别系统构成挑战,尤其对频繁使用creak的语言。本文提出一种深度学习模型检测流畅语音中的creaky voice。该模型由一同训练的编码器与分类器组成。编码器接收原始波形并使用卷积神经网络学习表征。分类器实现为多头全连接网络,训练用于检测creaky voice、发声与音高,后两者用于精炼creak预测。模型在由训练有素的语音学家标注creak的美国英语说话人语音上训练与测试。我们使用两种编码器评估系统性能:一种为任务定制,另一种基于最先进的无监督表征。结果表明,在未见数据上我们性能最佳的系统的召回率与F1分数较先前方法有所提升。

关键词

引用

@article{arxiv.2203.17019,
  title  = {DeepFry: Identifying Vocal Fry Using Deep Neural Networks},
  author = {Bronya R. Chernyak and Talia Ben Simon and Yael Segal and Jeremy Steffman and Eleanor Chodroff and Jennifer S. Cole and Joseph Keshet},
  journal= {arXiv preprint arXiv:2203.17019},
  year   = {2022}
}

备注

Accepted to Interspeech 2022