中文

面向低资源印度语言的 ASR 模型自适应

音频与语音处理 2023-07-18 v1 计算与语言

摘要

近年来,自动语音识别(ASR)性能得到了显著改善,这主要得益于基于自监督学习(SSL)的声学模型(如 wav2vec2)和大规模多语言训练(如 Whisper)。对于音频和文本都有限的低资源语言,仍然存在巨大挑战。印度语言中存在多种方言,使这一问题更加复杂。然而,许多印度语言可归为同一语系,并共享相同的文字和语法结构。这正是可以应用大量自适应和微调技术,通过利用资源充足的相似语言来克服数据低资源特性的地方。在此类场景中,理解每种模态(如声学和文本)在构建可靠 ASR 中的重要性程度至关重要。可能存在这样的情况:某种语言丰富的声学数据降低了对大型纯文本语料库的需求。或者,由于各种预训练声学模型的可用性,反之亦然也可能成立。在本提议的特别分会中,我们鼓励社区利用孟加拉语和博杰普尔语这两种低资源印度语言的数据探索这些思路。这些方法不仅限于印度语言,其解决方案潜在适用于世界各地各种语言。

关键词

引用

@article{arxiv.2307.07948,
  title  = {Model Adaptation for ASR in low-resource Indian Languages},
  author = {Abhayjeet Singh and Arjun Singh Mehta and Ashish Khuraishi K S and Deekshitha G and Gauri Date and Jai Nanavati and Jesuraja Bandekar and Karnalius Basumatary and Karthika P and Sandhya Badiger and Sathvik Udupa and Saurabh Kumar and Savitha and Prasanta Kumar Ghosh and Prashanthi V and Priyanka Pai and Raoul Nanavati and Rohan Saxena and Sai Praneeth Reddy Mora and Srinivasa Raghavan},
  journal= {arXiv preprint arXiv:2307.07948},
  year   = {2023}
}

备注

ASRU Special session overview paper