中文

以跨语言正字法–音系联合复杂度度量学习发音

计算与语言 2022-02-11 v2

摘要

机器学习模型使我们能够通过展示每种语言中某项任务学习和良好执行的难度来比较语言。遵循这一研究思路,我们通过建模字素到音素(g2p)音译任务来探究是什么让一门语言“难以发音”。通过在 22 种语言上训练字符级 transformer 模型完成该任务,并对照其字素与音素 inventory 衡量模型熟练度,我们表明某些特征浮现出来,将学习发音方面较易与较难的语言区分开。即,一门语言从其正字法出发的发音复杂度源于其字素到音素映射的表现力或简略性。进一步讨论说明了未来研究应如何考虑每种语言相对的数据稀疏性,以设计更公平的跨语言比较任务。

关键词

引用

@article{arxiv.2202.00794,
  title  = {Learning to pronounce as measuring cross-lingual joint orthography-phonology complexity},
  author = {Domenic Rosati},
  journal= {arXiv preprint arXiv:2202.00794},
  year   = {2022}
}

备注

Submitted and Accepted to NLPML 2022