中文

塔吉克-法尔斯语对机器转写模型系统性基准:从规则模型到 Transformer 架构的比较研究

计算与语言 2026-05-05 v1

摘要

本文提出了现代机器学习架构用于塔吉克(西里尔字母)和波斯语(阿拉伯字母)之间转写的首个全面比较分析。一个关键贡献是创建和验证了一个独特的平行语料库,来自多个异构来源,包括众包项目、词典对、“施那维希”平行文本、外交文章、“马斯波尼-马瓦尼”文本、官方术语列表以及转写对应关系。初始数据集包含 328,253 个句子对;使用分层随机抽样形成了代表性的 40,000 个对的子集。实验比较了六类模型:规则基线、带注意力的 LSTM、字符级 Transformer、从头训练的 G2P Transformer、预训练的多语言模型(mBART、mT5 带 LoRA)以及字节级 ByT5。结果显示,ByT5 在塔吉克到法尔斯的 chrF++ 为 87.4,反向为 80.1,凌驾于其他模型。G2P Transformer 显著优于 mBART(72.3 vs. 62.2 chrF++),尽管数据有限。使用子词分词的模型(mT5)完全失败(chrF++ 小于 18.5)。我们的发现表明,要准确地进行塔吉克-法尔斯语对的转写,字节或字符级的架构在准确性上是明确优于传统依赖子词分词的多语言 Seq2Seq 模型的。

关键词

引用

@article{arxiv.2605.02270,
  title  = {A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures},
  author = {Mullosharaf K. Arabov},
  journal= {arXiv preprint arXiv:2605.02270},
  year   = {2026}
}

备注

Preprint