中文

提高非正式罗马化语言识别准确率

计算与语言 2025-11-19 v3

摘要

拉丁字母经常用于非拉丁母语脚本的语言的非正式书写。在许多情况下(例如印度大多数语言),由于缺乏拉丁脚本中的惯用拼写,导致拼写变异性很高。这种罗马化会使本通常因书写在不同脚本中而容易区分的语言(例如印地语和Urdu)高度易混淆。在本工作中,我们通过改进用于合成训练集的方法来提高罗马化文本的语言识别(LID)准确率。我们发现,针对包含自然拼写变异的合成样本进行训练,比包括可获得的自然发生示例进行训练或甚至训练更高容量模型,能获得更高的LID系统准确率。在Bhasha-Abhijnaanam评估集( Madhani 等,2023a)上对20种印度语言的罗马化文本实现了新的SOTA LID性能,将测试F1从报告的74.7%(使用预训练神经模型)提高到85.4%(仅使用合成数据训练的线性分类器),并在也训练了可收集文本时提高到88.2%。

关键词

引用

@article{arxiv.2504.21540,
  title  = {Improving Informally Romanized Language Identification},
  author = {Adrian Benton and Alexander Gutkin and Christo Kirov and Brian Roark},
  journal= {arXiv preprint arXiv:2504.21540},
  year   = {2025}
}

备注

19 pages, 16 tables, 4 figures