中文

基于音节分析构建泰卢固语听写系统

计算与语言 2010-01-14 v1 人机交互

摘要

近几十年来,语音交互系统日益重要。要开发类似Dragon的印度语言听写系统,关键在于使系统能够以最少的训练适应说话者。本文重点探讨了以音节为单位创建语音数据库的重要性,以及在训练任何语音识别系统时需考虑的最小文本量。目前已有针对英语及少数印度语言(如印地语和泰米尔语)的连续语音识别系统。本文给出了泰卢固语音节的统计细节,及其在语音识别过程中最小化搜索空间的应用。识别出了覆盖最多音节的最小词汇集。该词汇列表可用于准备一小段文本,用于在训练听写系统时收集语音样本。结果以音节频率和每个单词中音节数量的图表形式呈现。该方法应用于CIIL迈索尔文本语料库(包含300万个单词)。

关键词

引用

@article{arxiv.1001.2263,
  title  = {Syllable Analysis to Build a Dictation System in Telugu language},
  author = {N. Kalyani and Dr K. V. N. Sunitha},
  journal= {arXiv preprint arXiv:1001.2263},
  year   = {2010}
}

备注

6 pages IEEE format, International Journal of Computer Science and Information Security, IJCSIS December 2009, ISSN 1947 5500, http://sites.google.com/site/ijcsis/