中文

Sinhala Transliteration:基于规则方法与 Seq2Seq 方法的比较分析

计算与语言 2025-03-05 v1

摘要

由于便利性和技术素养不足的原因,在低资源语言(如 Sinhala)的语境中, transliteration(即使用罗马化脚本而非本地化工具来罗马化本土脚本)非常普遍,这些语言拥有自己的书写脚本。本研究聚焦于罗马化 Sinhala Transliteration。我们提出了两种方法来解决此问题:我们的基线方法是基于规则的方法,然后与我们第二种方法进行比较,后者将 transliteration 问题视为序列到序列任务,类似于已建立的神经机器翻译 (NMT) 任务。对于后者,我们提出了基于 Transformer 的 Encode-Decoder 解决方案。我们观察到,基于 Transformer 的方法能够捕捉罗马化脚本中许多非寻常的模式,而基于规则的方法则不行。与本论文相关的 codebases 可在 GitHub 上获取 - https://github.com/kasunw22/Sinhala-Transliterator/。

关键词

引用

@article{arxiv.2501.00529,
  title  = {Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches},
  author = {Yomal De Mel and Kasun Wickramasinghe and Nisansa de Silva and Surangika Ranathunga},
  journal= {arXiv preprint arXiv:2501.00529},
  year   = {2025}
}

备注

8 pages, 7 tables