基于平行词典语料库的 Tajik-Persian 字符级 Transformer 转写
计算与语言
2026-05-12 v1
摘要
本研究针对从 Tajik(西里尔字母)向 Persian(波斯阿拉伯字母)的自动转写进行了研究。我们构建了一个包含 52,152 个 Tajik-Persian 单词和短语的 curated、经过词典验证的平行语料库,来源于印刷词典、百科全书资料以及经人工核查的在线资源。据我们所知,这是目前规模最大的面向 Tajik-Persian 转写的公开词级语料库。基于该语料库,我们训练了一个字符级序列到序列 Transformer 模型,使用字符错误率 (CER) 和 exact-match accuracy 进行评估。Transformer 取得 CER 为 0.3216、exact-match accuracy 为 0.3133 的成绩,优于基于词典的规则方法和循环神经网络基线。采用 beam search (k=3) 可进一步提升至 CER 0.3182、accuracy 0.3215。我们描述了数据收集与预处理流程、模型架构和实验协议,并报告了部分词性分析,显示不同词典类别下的性能差异。我们发布了所有预处理脚本、确定性的训练/验证/测试划分以及训练配置,以支持可重复性和进一步研究,涵盖 Tajik 及相关波斯方言。该语料库支持字符级转写、跨脚本 NLP 以及词典学应用的研究。
引用
@article{arxiv.2605.09092,
title = {Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus},
author = {Mullosharaf K. Arabov},
journal= {arXiv preprint arXiv:2605.09092},
year = {2026}
}
备注
Published in Proceedings of the 2nd Workshop on NLP for Languages Using Arabic Script (AbjadNLP), pages 75-83, Rabat, Morocco, March 2026