中文

BanglaSTEM:面向技术领域的巴尔语-英语平行语料库

计算与语言 2025-11-06 v1 机器学习

摘要

大型语言模型在英语中能够很好地解决技术问题,但在相同问题以巴尔语提出时表现较差。一个简单的解决方案是首先将巴尔语问题翻译成英语,然后再使用这些模型。然而,现有的巴尔语-英语翻译系统在处理技术术语方面存在挑战,常常误译专业术语,这会改变问题含义并导致错误答案。我们提出BanglaSTEM,一个来自STEM领域(包括计算机科学、数学、物理、化学和生物学)的5000个精心挑选的巴尔语-英语句子对数据集。我们使用语言模型生成超过12000个翻译,然后由人类评估者筛选出保留技术术语正确性的最高质量的句子对。我们在BanglaSTEM上训练T5-based翻译模型,并在两个任务上进行测试:代码生成和数学问题求解。我们的结果表明,针对技术内容的翻译准确率显著提高,使巴尔语使用者能够有效地利用以英语为中心的语言模型。BanglaSTEM数据集和训练好的翻译模型均已公开发布于https://huggingface.co/reyazul/BanglaSTEM-T5。

关键词

引用

@article{arxiv.2511.03498,
  title  = {BanglaSTEM: A Parallel Corpus for Technical Domain Bangla-English Translation},
  author = {Kazi Reyazul Hasan and Mubasshira Musarrat and A. B. M. Alim Al Islam and Muhammad Abdullah Adnan},
  journal= {arXiv preprint arXiv:2511.03498},
  year   = {2025}
}