FluentNet:基于深度学习的端到端语音不流畅检测
音频与语音处理
2020-09-25 v1 机器学习
声音
摘要
较强的演讲技巧在职场和课堂环境中都很有价值且备受青睐。在可能的语音演示改进中,不流畅和口吃尤其仍是某人表现中最常见和突出的因素之一。数百万人受到口吃和其他语音不流畅的影响,世界上大多数人在压力条件下交流时都经历过轻微口吃。尽管在自动语音识别和语言模型领域已有大量研究,但在不流畅检测与识别方面仍缺乏足够的工作。为此,我们提出了一种端到端深度神经网络 FluentNet,能够检测多种不同的不流畅类型。FluentNet 由一个 Squeeze-and-Excitation 残差卷积神经网络组成,其有助于学习强大的谱帧级表示,随后是一组双向长短期记忆层,有助于学习有效的时间关系。最后,FluentNet 使用注意力机制聚焦于语音的重要部分以获得更好性能。我们进行了大量不同的实验、比较和消融研究来评估我们的模型。我们的模型在公开可用的 UCLASS 数据集上超越了该领域其他方案,取得了 SOTA 结果。此外,我们提出了 LibriStutter:一个基于公开 LibriSpeech 数据集并合成口吃的不流畅数据集。我们也在该数据集上评估了 FluentNet,展示了我们的模型相对于多种基准技术的强劲性能。
引用
@article{arxiv.2009.11394,
title = {FluentNet: End-to-End Detection of Speech Disfluency with Deep Learning},
author = {Tedd Kourkounakis and Amirhossein Hajavi and Ali Etemad},
journal= {arXiv preprint arXiv:2009.11394},
year = {2020}
}
备注
13 pages, 6 figures