中文

BanglaDialecto:端到端 AI 驱动的区域语音标准化

计算与语言 2024-11-19 v1 人工智能 机器学习 声音 音频与语音处理

摘要

本研究聚焦于识别孟加拉国方言,并将多样的孟加拉语口音转换为标准化正式孟加拉语语音。方言通常被称为地区语言,是在特定地区使用的语言变体,以其语音、发音和词汇为特征。发音和语调的细微变化也受地理位置、教育程度和社会经济地位影响。方言标准化对于确保有效沟通、教育一致性、技术获取、经济机会以及在尊重文化多样性的同时保护语言资源是必要的。孟加拉语作为第五大使用人数最多的语言,拥有约 55 种由 1.6 亿人使用的独特方言,解决孟加拉方言问题对开发包容性沟通工具至关重要。然而,由于缺乏全面数据集和处理多样方言的挑战,相关研究有限。随着多语言大语言模型 (mLLMs) 的进步,解决方言自动语音识别 (ASR) 和机器翻译 (MT) 挑战的新可能性应运而生。本研究提出了一种将方言 Noakhali 语音转换为标准孟加拉语语音的端到端流程。本研究包括构建一个包含方言语音信号的大规模多样数据集,用于定制 ASR 和 LLM 中的微调过程,以将方言语音转录为方言文本,并将方言文本翻译为标准孟加拉语文本。我们的实验表明,微调 Whisper ASR 模型实现了 0.8% 的字符错误率 (CER) 和 1.5% 的词错误率 (WER),而 BanglaT5 模型在方言到标准文本翻译中获得了 41.6% 的 BLEU 分数。

关键词

引用

@article{arxiv.2411.10879,
  title  = {BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization},
  author = {Md. Nazmus Sadat Samin and Jawad Ibn Ahad and Tanjila Ahmed Medha and Fuad Rahman and Mohammad Ruhul Amin and Nabeel Mohammed and Shafin Rahman},
  journal= {arXiv preprint arXiv:2411.10879},
  year   = {2024}
}

备注

Accepted in 2024 IEEE International Conference on Big Data (IEEE BigData)