中文

基于 Transformer 的低资源语言翻译:巴尔喀什语至西希提语研究

计算与语言 2025-10-23 v1 计算机与社会

摘要

机器翻译(MT)已从规则驱动和统计方法发展到基于 Transformer 架构的神经方法。虽然这些方法在高资源语言方面取得了令人印象深刻的成绩,但低资源变体如西希提语仍未得到充分探索。本文通过微调多语言 Transformer 模型,研究了巴尔喀什语至西希提语的翻译,并与零样本大型语言模型(LLM)进行比较。实验结果表明,微调模型显著优于 LLM,其中 mBART-50 实现了最高的翻译 adequacy,MarianMT 显示出最强的字符级忠实性。这些发现凸显了针对边缘语言进行任务特定适配的重要性,为包容性语言技术的持续努力做出了贡献。

关键词

引用

@article{arxiv.2510.18898,
  title  = {Transformer-Based Low-Resource Language Translation: A Study on Standard Bengali to Sylheti},
  author = {Mangsura Kabir Oni and Tabia Tanzin Prama},
  journal= {arXiv preprint arXiv:2510.18898},
  year   = {2025}
}