中文

用于自动音系重构与同源词反射预测的同源词 Transformer

计算与语言 2023-12-27 v2

摘要

音系重构是历史语言学的核心问题之一,其从观察到的子语言同源词中确定一个祖语的原词。计算历史语言学方法试图通过在可用语言数据上学习模型来使该任务自动化。若干源自计算生物学的思想与技术已成功应用于计算历史语言学领域。遵循这些思路,我们将蛋白质语言模型 MSA Transformer 适配于自动音系重构问题。MSA Transformer 以多序列比对作为输入进行训练,因此适用于对齐同源词的应用。故此,我们将模型命名为 Cognate Transformer(同源词 Transformer)。我们还将该模型应用于另一相关任务,即同源词反射预测,其中基于其他子语言的同源词预测某子语言中的反射词。我们表明,我们的模型在两项任务上均优于现有模型,尤其是在其对掩码词预测任务进行预训练时。

关键词

引用

@article{arxiv.2310.07487,
  title  = {Cognate Transformer for Automated Phonological Reconstruction and Cognate Reflex Prediction},
  author = {V. S. D. S. Mahesh Akavarapu and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2310.07487},
  year   = {2023}
}

备注

Accepted at EMNLP-2023 (Main)