中文

使用基于 Transformer 的模型进行罗马乌尔都语与乌尔都语的低资源音译

计算与语言 2025-04-07 v2 人工智能

摘要

随着信息检索 (IR) 领域日益认识到包容性的重要性,满足低资源语言的需求仍然是一个重大挑战。尽管乌尔都语及其罗马化形式罗马乌尔都语在南亚被广泛使用,但两者之间的音译仍未得到充分探索。先前在 Roman-Urdu-Parl 数据集上使用 RNN 的工作显示了有希望的结果,但存在领域适应性差和评估受限的问题。我们提出了一种基于 Transformer 的方法,使用 m2m100 多语言翻译模型,并辅以掩码语言建模 (MLM) 预训练以及在 Roman-Urdu-Parl 和领域多样的 Dakshina 数据集上进行微调。为了解决先前的评估缺陷,我们引入了严格的数据集划分,并使用 BLEU、字符级 BLEU 和 CHRF 评估性能。我们的模型取得了强劲的音译性能,Urdu->Roman-Urdu 的 Char-BLEU 得分为 96.37,Roman-Urdu->Urdu 的得分为 97.44。这些结果优于 RNN 基线与 GPT-4o Mini,并证明了多语言迁移学习在低资源音译任务中的有效性。

关键词

引用

@article{arxiv.2503.21530,
  title  = {Low-Resource Transliteration for Roman-Urdu and Urdu Using Transformer-Based Models},
  author = {Umer Butt and Stalin Veranasi and Günter Neumann},
  journal= {arXiv preprint arXiv:2503.21530},
  year   = {2025}
}