OTEANN: 用人工神经网络估计文字系统的透明程度
计算与语言
2021-09-23 v4
摘要
为将口语转写为书写媒介,多数字母表支持无歧义的音-字规则。然而,某些文字系统已偏离这一简单概念,而自然语言处理(NLP)中关于度量此种距离的工作甚少。本研究中,我们使用人工神经网络(ANN)模型评估书写词与其发音间的透明度,故名 Orthographic Transparency Estimation with an ANN(OTEANN)。基于源自 Wikimedia 词典的数据集,我们训练并测试该模型,以在音素-字素与字素-音素转写任务中给正确预测的百分比打分。在 17 种文字系统上所得分数与其他研究的估计一致。有趣的是,该模型还揭示了仅考虑音位规则进行读写的学习者的典型错误。
引用
@article{arxiv.1912.13321,
title = {OTEANN: Estimating the Transparency of Orthographies with an Artificial Neural Network},
author = {Xavier Marjou},
journal= {arXiv preprint arXiv:1912.13321},
year = {2021}
}
备注
9 pages, 9 figures, 3 tables