中文

噪声环境下面向机器人应用的儿童语音自动识别

计算与语言 2016-11-10 v1 声音

摘要

自动语音识别(ASR)为儿童机器人教育应用提供了自然直观的接口。然而,要使此类接口在真实环境中稳健运行,需克服若干挑战,包括识别儿童语音的内在困难以及教室中常存在的高背景噪声。作为欧盟EASEL项目的一部分,我们为应对这些挑战做出了若干贡献,实现了用于机器人应用的自有ASR模块。我们采用了最新的深度神经网络算法,其性能较传统GMM方法实现飞跃,并应用数据增强方法以提升对噪声和说话人变化的鲁棒性。我们提供了ASR模块与对话系统其余部分的紧密集成,使ASR能实时接收与对话当前段落相关的语言模型,大幅提高了准确率。我们将ASR模块集成到一个交互式多模态系统中,使用小型人形机器人帮助儿童了解运动与能量。该系统作为研究项目的一部分安装在公共博物馆活动中,320名儿童(年龄3至14岁)与机器人互动,我们的ASR对流利和近流利语音达到了90%的准确率。

关键词

引用

@article{arxiv.1611.02695,
  title  = {Automatic recognition of child speech for robotic applications in noisy environments},
  author = {Samuel Fernando and Roger K. Moore and David Cameron and Emily C. Collins and Abigail Millings and Amanda J. Sharkey and Tony J. Prescott},
  journal= {arXiv preprint arXiv:1611.02695},
  year   = {2016}
}

备注

Submission to Computer Speech and Language, special issue on Interaction Technologies for Children