中文

Advancing Bangla Machine Translation Through Informal Datasets

计算与语言 2025-12-16 v1

摘要

孟加拉语是全球第六大语言,拥有约 2.34 亿 native 说话者。然而,开源孟加拉语机器翻译的进展仍有限。大多数在线资源为英文,往往未翻译成孟加拉语,导致数百万人无法获取必需信息。现有研究主要关注正式语言,忽略更常用的非正式语言。这主要源于缺乏成对的孟加拉-英文数据和先进的翻译模型。如果能够通过改进数据集和模型来更好地处理自然、非正式的孟加拉语,将为数百万人带来更好的在线信息获取。本研究探索当前最先进的模型,并通过开发来自非正式来源(如社交媒体和对话文本)的数据集来改进孟加拉语翻译。本工作旨在通过关注非正式语言翻译来推动孟加拉语机器翻译,并提高孟加拉语说话者在数字世界中的可及性。

关键词

引用

@article{arxiv.2512.13487,
  title  = {Advancing Bangla Machine Translation Through Informal Datasets},
  author = {Ayon Roy and Risat Rahaman and Sadat Shibly and Udoy Saha Joy and Abdulla Al Kafi and Farig Yousuf Sadeque},
  journal= {arXiv preprint arXiv:2512.13487},
  year   = {2025}
}

备注

33 pages, 13 figures