中文

多语言同源词聚类的快速无监督方法

计算与语言 2017-02-17 v1

摘要

本文探索使用无监督方法检测多语言词表中的同源词。我们利用在线EM训练音段相似性权重,以计算两个词之间的相似性。我们在地理上分布的世界十六个不同语系上测试了我们的在线系统,表明在线PMI系统(逐点互信息)优于基于HMM的系统以及两种基于语言学动机的系统:LexStat和ALINE。我们的结果表明,以在线方式训练的PMI系统可被历史语言学家用于快速准确地识别研究尚不充分的语系中的同源词。

关键词

引用

@article{arxiv.1702.04938,
  title  = {Fast and unsupervised methods for multilingual cognate clustering},
  author = {Taraka Rama and Johannes Wahle and Pavel Sofroniev and Gerhard Jäger},
  journal= {arXiv preprint arXiv:1702.04938},
  year   = {2017}
}