中文

缩略词的语言无关获取

计算与语言 2017-09-26 v1

摘要

本文探讨从纯非结构化文本中自动提取缩略词(包括首字母缩略词和首字母拼写词)及其对应的全称展开。我们创建并将发布一个关于缩略词及其对应展开的多语言资源,该资源通过利用 Wikipedia 重定向和消歧页面自动构建,可用作评估基准。我们解决了先前工作的一个缺陷,即仅使用了重定向页面,因此每个缩略词只有一个展开,尽管许多缩略词可能有多个不同的展开。我们还开发了一种基于机器学习的有原则的展开候选评分方法,使用了近义性指标、主题相关性和表面相似性等不同技术。我们展示了相对于强基线在七种语言(包括两种使用非拉丁字母的语言)上的性能提升。

关键词

引用

@article{arxiv.1709.08074,
  title  = {Language Independent Acquisition of Abbreviations},
  author = {Michael R. Glass and Md Faisal Mahbub Chowdhury and Alfio M. Gliozzo},
  journal= {arXiv preprint arXiv:1709.08074},
  year   = {2017}
}

备注

9 pages, 7 figues, 2 tables