中文

从文本推断语言类型学特征:世界语言结构图谱的稀疏特征推断

计算与语言 2020-05-06 v2 机器学习

摘要

语言类型学资源在自然语言处理中的使用一直在稳步增长。已观察到类型学信息的使用,通常与分布式语言表示相结合,会带来显著更强大的模型。虽然来自各种资源的语言类型学表示大多被用于调节模型,但从输入数据预测这些资源中的特征却相对较少受到关注。在本文中,我们研究来自世界语言结构图谱(WALS)的各种语言特征是否可以从多语言文本中可靠地推断。这样的预测器可用于推断在训练数据中从未观察到的语言的结构特征。我们将此任务构建为涉及预测非互斥且极度稀疏的多值标签集(WALS 特征)的多标签分类。我们构建了一个基于字节嵌入和卷积层的循环神经网络预测器,并在 556 种语言上测试其性能,针对各种语言类型、宏观区域、语系和个别特征提供分析。我们表明,来自各种语言类型的某些特征可以被可靠地预测。

关键词

引用

@article{arxiv.2005.00100,
  title  = {Linguistic Typology Features from Text: Inferring the Sparse Features of World Atlas of Language Structures},
  author = {Alexander Gutkin and Tatiana Merkulova and Martin Jansche},
  journal= {arXiv preprint arXiv:2005.00100},
  year   = {2020}
}

备注

Originally prepared as a conference submission to EMNLP 2018