中文

基于无监督音译的假朋友检测与实体匹配

计算与语言 2016-11-22 v1

摘要

音译在多语言实体引用解析中起着重要作用,因为专有名词在新闻和社交媒体中越来越多地跨语言传播。以往与机器翻译相关的工作仅在单一语言对之间进行音译,侧重于特定类别的实体(如城市和名人),并依赖人工标注,这限制了音译在多语言环境中的表达能力。相比之下,我们提出了一种涵盖 69 种主要语言的无监督音译模型,能够为任意语言对之间的任意字符串生成良好的音译。在匹配金标准音译方面,我们的模型取得了 (32.85%, 60.44%, 83.20%) 的 top-(1, 20, 100) 平均值,而近期发表的一个系统的结果为 (26.71%, 50.27%, 72.79%)。我们还展示了我们的模型在从维基百科高频词典中检测真假朋友方面的质量。我们的方法表明了发音相似性的强信号,并在 69 种语言中的 68 种里提高了发现真朋友的概率。

关键词

引用

@article{arxiv.1611.06722,
  title  = {False-Friend Detection and Entity Matching via Unsupervised Transliteration},
  author = {Yanqing Chen and Steven Skiena},
  journal= {arXiv preprint arXiv:1611.06722},
  year   = {2016}
}

备注

11 Pages, ACL style