中文

面向音乐播放设备远场语音控制的语音识别前端设计与优化

声音 2014-05-07 v1 计算与语言

摘要

本文针对音乐播放设备(一种常见的便携式扬声器,四个小型扬声器紧密围绕一个麦克风)的远场语音控制这一挑战性场景展开研究。用户通过语音控制设备,而在音乐播放期间,语音与音乐的比率可低至 -30 dB。我们提出了一种语音增强前端,该前端依赖于已知的鲁棒方法(包括回声消除、双讲检测和噪声抑制),以及一种专为语音识别设计的新型自适应准二值掩码。随后,我们将系统优化表述为一个大规模非线性规划问题,旨在最大化识别率,并通过遗传算法寻找系统参数的最优值。我们在 TIMIT 数据库上针对不同音乐播放电平和噪声类型验证了该方法。最后,我们表明所提出的前端能够实现对有限词汇语音命令的自然设备交互。

关键词

引用

@article{arxiv.1405.1379,
  title  = {Design and Optimization of a Speech Recognition Front-End for Distant-Talking Control of a Music Playback Device},
  author = {Ramin Pichevar and Jason Wung and Daniele Giacobello and Joshua Atkins},
  journal= {arXiv preprint arXiv:1405.1379},
  year   = {2014}
}