中文

一种度量同源词语义分歧的计算方法

计算与语言 2020-12-03 v1

摘要

意义是跨文化交流的基石。语言在不断变化,词语因各种原因发生语义转移。亲属语言中的语义分歧是历史语言学的核心关切。本文通过度量多种语言中同源词集的语义相似性,研究跨语言的语义分歧。我们提出的方法基于跨语言词嵌入。本文在英语和五种罗曼语上实现并评估了该方法,但它可轻松扩展到任意语言对,仅需相关语言的大型单语语料库和该语言对的小型双语词典。这种与语言无关的方法通过计算机同源词对之间的语义相似度,促进了同源词分歧的定量分析,并为识别假朋友提供了洞见。作为第二项贡献,我们提出了一种直接的假朋友检测方法,并引入了“软假朋友”和“硬假朋友”的概念,以及衡量假朋友对“虚假程度”的度量。此外,我们提出了一种算法,可输出纠正假朋友的建议,这有望成为语言学习或翻译的极有帮助的工具。

关键词

引用

@article{arxiv.2012.01288,
  title  = {A Computational Approach to Measuring the Semantic Divergence of Cognates},
  author = {Ana-Sabina Uban and Alina-Maria Ciobanu and Liviu P. Dinu},
  journal= {arXiv preprint arXiv:2012.01288},
  year   = {2020}
}