解析语音:一种整合词汇与声学-韵律信息的神经方法
计算与语言
2018-04-17 v2 机器学习
声音
摘要
在会话语音中,声学信号提供有助于听者消歧困难解析的线索。对于自动解析口语话语,我们引入了一个模型,该模型利用在能量和音高轨迹上的卷积神经网络与接受文本和韵律特征的基于注意力的循环神经网络相结合,来整合转写文本和声学-韵律特征。我们发现不同类型的声学-韵律特征各自有帮助,并且一起在解析和不流利检测F1分数上比强大的纯文本基线给出统计显著的改进。对于这项具有已知句子边界的研究,错误分析显示声学-韵律特征的主要益处在于含有不流利现象的句子中,附加决策改善最多,且转写错误掩盖了来自韵律的增益。
引用
@article{arxiv.1704.07287,
title = {Parsing Speech: A Neural Approach to Integrating Lexical and Acoustic-Prosodic Information},
author = {Trang Tran and Shubham Toshniwal and Mohit Bansal and Kevin Gimpel and Karen Livescu and Mari Ostendorf},
journal= {arXiv preprint arXiv:1704.07287},
year = {2018}
}
备注
Accepted in NAACL HLT 2018