中文

ChakmaNMT:通过音转写为低资源且濒危语言进行机器翻译

计算与语言 2026-01-09 v2

摘要

我们提出了首个针对 Chakma 这种濒危且极低资源的印度-阿拉伯语系语言的机器翻译系统,以支持语言可达性与保存。我们引入新的 Chakma-Bangla 平行语料库与单语料库,同时构建了 Chakma-Bangla-English 三语评测基准。为解决脚本不匹配与数据稀缺问题,提出基于字符级音转写框架,利用 Chakma 与 Bangla 之间紧密的拼写与语音关系,既保留语义内容又能有效迁移来自 Bangla 与多语言预训练模型的知识。我们对从头训练的机器翻译、微调预训练模型以及大语言模型的 in-context 学习进行基准测试。结果表明,音转写是必不可少的,微调与 in-context 学习显著优于从头训练的基线方法,在不同翻译方向上表现出显著的不对称性。

引用

@article{arxiv.2410.10219,
  title  = {ChakmaNMT: Machine Translation for a Low-Resource and Endangered Language via Transliteration},
  author = {Aunabil Chakma and Aditya Chakma and Masum Hasan and Soham Khisa and Chumui Tripura and Rifat Shahriyar},
  journal= {arXiv preprint arXiv:2410.10219},
  year   = {2026}
}

备注

Submitted to ARR (January 2026)