基于序列对齐的Transformer架构字符级孟加拉语文本到国际音标转写
计算与语言
2023-11-08 v1
摘要
国际音标(IPA)在语言学习与交流中不可或缺,帮助用户准确发音与理解。此外,它在言语治疗、语言研究、准确音译以及文本到语音系统开发中发挥关键作用,使其成为跨多个领域的重要工具。孟加拉语作为广泛使用的语言排名第7,催生了其领域内对IPA的需求。其IPA映射过于多样,难以手动捕捉,因而该领域需要人工智能与机器学习。本研究利用基于Transformer的序列到序列模型在字母与符号级别获取每个孟加拉语单词的IPA,因为不同单词间IPA的变异几乎为零。我们的Transformer模型仅含850万参数,且仅有一个解码器与一个编码器层。此外,为处理文本中的标点符号与外语出现情况,我们采用手动映射,因为模型无法学会将其与孟加拉语单词分离,同时这降低了所需计算资源。最后,通过保持句子成分IPA的相对位置并生成组合IPA,我们在 DataVerse Challenge - ITVerse 2023(https://www.kaggle.com/competitions/dataverse_2023/)公开排名中以0.10582的词错误率获得首位。
引用
@article{arxiv.2311.03792,
title = {Character-Level Bangla Text-to-IPA Transcription Using Transformer Architecture with Sequence Alignment},
author = {Jakir Hasan and Shrestha Datta and Ameya Debnath},
journal= {arXiv preprint arXiv:2311.03792},
year = {2023}
}
备注
Achieved top position with a word error rate of 0.10582 in the public ranking of DataVerse Challenge - ITVerse 2023 (link: https://www.kaggle.com/competitions/dataverse_2023/). All codes can be found on the respective competition webpage