构音障碍语音口语理解中预训练策略的研究
音频与语音处理
2021-06-16 v1
摘要
端到端(E2E)口语理解(SLU)系统通过将语音直接映射为带槽值的意图,避免了中间的文本表示。该方法需要大量的领域特定训练数据。在低资源场景下这是一个主要问题,例如本研究中处理的构音障碍语音 SLU。针对自动语音识别目标对 SLU 模型的一部分进行预训练有所帮助,但尚无研究表明构音障碍语音上的 SLU 在多大程度上受益于从其他构音障碍语音任务迁移的知识。本文研究了构音障碍语音 SLU 任务预训练策略的有效性。所设计的 SLU 系统由用于特征编码的 TDNN 声学模型和用于意图与槽解码的胶囊网络组成。声学模型分两阶段预训练:以正常语音语料初始化,并在构音障碍与正常语音混合数据上微调。通过引入可懂度分数作为损伤程度指标,本文定量分析了构音障碍语音的泛化能力与病理严重程度之间的关系。
引用
@article{arxiv.2106.08313,
title = {A Study into Pre-training Strategies for Spoken Language Understanding on Dysarthric Speech},
author = {Pu Wang and Bagher BabaAli and Hugo Van hamme},
journal= {arXiv preprint arXiv:2106.08313},
year = {2021}
}
备注
Accepted by Interspeech 2021