DeepFry:使用深度神经网络识别 vocal fry
音频与语音处理
2022-06-28 v2 机器学习
声音
摘要
Vocal fry或creaky voice指以不规则声门开启与低音高为特征的嗓音质量。它出现于多种语言中,且在美国英语中普遍,不仅用于标记短语终结,也用于社会语言学因素与情感。由于其不规则周期性,creaky voice对自动语音处理与识别系统构成挑战,尤其对频繁使用creak的语言。本文提出一种深度学习模型检测流畅语音中的creaky voice。该模型由一同训练的编码器与分类器组成。编码器接收原始波形并使用卷积神经网络学习表征。分类器实现为多头全连接网络,训练用于检测creaky voice、发声与音高,后两者用于精炼creak预测。模型在由训练有素的语音学家标注creak的美国英语说话人语音上训练与测试。我们使用两种编码器评估系统性能:一种为任务定制,另一种基于最先进的无监督表征。结果表明,在未见数据上我们性能最佳的系统的召回率与F1分数较先前方法有所提升。
引用
@article{arxiv.2203.17019,
title = {DeepFry: Identifying Vocal Fry Using Deep Neural Networks},
author = {Bronya R. Chernyak and Talia Ben Simon and Yael Segal and Jeremy Steffman and Eleanor Chodroff and Jennifer S. Cole and Joseph Keshet},
journal= {arXiv preprint arXiv:2203.17019},
year = {2022}
}
备注
Accepted to Interspeech 2022