中文

从机器学习视角综述印度口语语言识别

计算与语言 2022-12-08 v1 声音 音频与语音处理

摘要

自动口语语言识别 (LID) 在多语言基于语音指令的人机交互 (HCI) 时代是一个非常重要的研究领域。前端 LID 模块有助于提升多语言场景下许多基于语音的应用的性能。印度是一个人口众多、文化和语言多样的国家。大多数印度人口需要使用其各自的母语与机器进行语言交互。因此,高效的印度口语语言识别系统的开发对于智能技术在印度社会各阶层的适应是有用的。印度 LID 领域在过去二十年开始获得发展势头,主要由于若干印度语言标准多语言语音语料库的开发。尽管该领域已取得显著研究进展,但据我们所知,尚少有尝试对其进行分析性集体回顾。在本工作中,我们进行了非常早期的尝试之一,以对印度口语语言识别研究领域呈现一份全面综述。我们给出了深入分析以强调在低资源及相互影响方面开发印度语境下 LID 系统的独特挑战。文中讨论了印度 LID 研究的若干重要方面,例如可用语音语料库的详细描述、主要研究贡献(包括基于统计建模的早期尝试到基于不同神经网络架构的最近方法),以及未来研究趋势。本综述工作将帮助任何活跃研究者或相关领域的任何研究爱好者评估当前印度 LID 研究的状况。

关键词

引用

@article{arxiv.2212.03812,
  title  = {An Overview of Indian Spoken Language Recognition from Machine Learning Perspective},
  author = {Spandan Dey and Md Sahidullah and Goutam Saha},
  journal= {arXiv preprint arXiv:2212.03812},
  year   = {2022}
}

备注

Accepted for publication in ACM Transactions on Asian and Low-Resource Language Information Processing