弥合方言:使用神经模型将标准孟加拉语翻译为区域变体
计算与语言
2025-01-13 v1
摘要
孟加拉语包含许多区域方言,增添了其文化丰富性。由于吉大港、锡尔赫特、巴里萨尔、诺阿卡利和迈门辛等地区的词汇、发音和句子结构存在显著差异,将孟加拉语翻译为区域方言面临挑战。这些方言虽然对地方身份至关重要,但在技术应用中缺乏代表性。本研究通过使用神经机器翻译(NMT)模型(包括 BanglaT5、mT5 和 mBART50)将标准孟加拉语翻译为这些方言,填补了这一空白。该工作的动机是保护语言多样性和改善方言使用者之间的交流。模型使用包含 32,500 个句子(涵盖多种方言)的“Vashantor”数据集进行微调,并通过字符错误率(CER)和词错误率(WER)指标进行评估。BanglaT5 表现出优越性能,CER 为 12.3%,WER 为 15.7%,突显了其在捕捉方言细微差别方面的有效性。本研究的结果有助于开发支持区域方言和促进语言多样性的包容性语言技术。
引用
@article{arxiv.2501.05749,
title = {Bridging Dialects: Translating Standard Bangla to Regional Variants Using Neural Models},
author = {Md. Arafat Alam Khandaker and Ziyan Shirin Raha and Bidyarthi Paul and Tashreef Muhammad},
journal= {arXiv preprint arXiv:2501.05749},
year = {2025}
}
备注
Accepted in 2024 27th International Conference on Computer and Information Technology (ICCIT)