利用语音先验破译欠分割的古代文字
计算与语言
2020-10-22 v1
摘要
大多数未破译的失落语言呈现出两个给破译带来重大挑战的特征:(1) 文字未完全分割成词;(2) 最接近的已知语言尚未确定。我们提出一种破译模型,通过构建反映历史语音变化一致模式的丰富语言学约束来处理这两大挑战。我们基于国际音标(IPA)学习字符嵌入,从而捕捉自然的音位几何结构。由此产生的生成框架在音系约束的指导下联合建模词分割与同源词对齐。我们在已破译语言(哥特语、乌加里特语)与一种未破译语言(伊比利亚语)上评估该模型。实验表明,引入语音几何带来了清晰且一致的提升。此外,我们提出一种语言亲近度度量,可正确识别哥特语与乌加里特语的亲属语言。对于伊比利亚语,该方法未给出支持巴斯克语为其亲属语言的强证据,与当前学界主流观点一致。
引用
@article{arxiv.2010.11054,
title = {Deciphering Undersegmented Ancient Scripts Using Phonetic Prior},
author = {Jiaming Luo and Frederik Hartmann and Enrico Santus and Yuan Cao and Regina Barzilay},
journal= {arXiv preprint arXiv:2010.11054},
year = {2020}
}
备注
TACL 2020, pre-MIT Press publication version