中文

面向移动应用的说话人无关连续语音转文本转换器

计算与语言 2013-07-23 v1 神经与进化计算 声音

摘要

本文提出了一种用于移动应用的高效语音转文本转换器。主要目标是构建一个系统,使其在复杂性、准确性、延迟和内存需求方面为移动环境提供最佳性能。该语音转文本转换器包含两个阶段,即前端分析和模式识别。前端分析涉及预处理和特征提取。传统的语音活动检测 (VAD) 算法仅跟踪能量,无法成功从输入中识别出潜在语音,因为语音的非期望部分也具有一定的能量并表现为语音。在 proposed 系统中,使用了分别计算高频部分能量和过零率以区分噪声与语音的 VAD。采用梅尔频率倒谱系数 (MFCC) 作为特征提取方法,并使用广义回归神经网络作为识别器。MFCC 提供了较低的词错误率和更好的特征提取效果。神经网络提高了准确性。因此,一个包含用户所有可能音节发音的小型数据库足以提供接近 100% 的识别准确率。从而,所提出的技术支持实现如移动电话、PDA 等实时说话人无关应用。

关键词

引用

@article{arxiv.1307.5736,
  title  = {Speaker Independent Continuous Speech to Text Converter for Mobile Application},
  author = {R. Sandanalakshmi and P. Abinaya Viji and M. Kiruthiga and M. Manjari and M. Sharina},
  journal= {arXiv preprint arXiv:1307.5736},
  year   = {2013}
}