面向低资源语音到意图应用的预训练
音频与语音处理
2021-04-01 v1 计算与语言
人机交互
声音
摘要
设计一种将用户语音命令映射到智能体期望任务动作的语音到意图(S2I)智能体可能具有挑战性,因为不同用户存在多样的语法和词汇偏好。作为补救,我们在本文中讨论一种用户教导的S2I系统。该用户教导系统从用户的语音输入与动作演示中从零开始学习,从而确保其完全匹配用户表述意图的方式及其发音习惯。主要问题是由于涉及用户投入而导致的训练数据稀缺。该设定下现有的state-of-the-art方法基于非负矩阵分解(NMF)与胶囊网络。在本文中,我们将端到端ASR系统的编码器与先前基于NMF/胶囊网络的用户教导解码器相结合,并研究预训练方法能否减少NMF与胶囊网络的训练数据需求。实验结果表明预训练的ASR-NMF框架显著优于其他模型,并且我们还讨论了在不同类型命令与控制(C&C)应用中预训练的局限性。
引用
@article{arxiv.2103.16674,
title = {Pre-training for low resource speech-to-intent applications},
author = {Pu Wang and Hugo Van hamme},
journal= {arXiv preprint arXiv:2103.16674},
year = {2021}
}