中文

阿拉伯语文献书目的自动罗马化

计算与语言 2021-03-15 v1

摘要

国际图书馆标准要求编目员费力地输入其目录记录的罗马化,以惠及不具备特定语言专业知识的图书馆用户。在本文中,我们给出了关于无变音符号阿拉伯语文献条目自动罗马化任务的首次报道结果。这一复杂任务需要对阿拉伯语音系、形态乃至语义进行建模。我们收集了 250 万词的阿拉伯语与罗马化文献条目平行语料库,并以复杂度和资源依赖度各异的若干模型进行了基准测试。我们的最佳系统在盲测集上达到了 89.3% 的精确词罗马化率。我们公开了数据和代码。

关键词

引用

@article{arxiv.2103.07199,
  title  = {Automatic Romanization of Arabic Bibliographic Records},
  author = {Eryani Fadhl and Habash Nizar},
  journal= {arXiv preprint arXiv:2103.07199},
  year   = {2021}
}

备注

WANLP 2021 Camera-ready, 5 pages