中文

处理斯洛文尼亚传记词典中的缩写

计算与语言 2022-11-07 v1

摘要

缩写为 NLP 系统带来显著挑战,因其引发分词与未登录词错误。它们也会降低文本可读性,尤其在大量使用缩写的参考印刷书籍中。缩写尤其在低资源环境下成问题,因系统本身鲁棒性较低。本文提出一种新方法,以解决文本中高密度领域特定缩写所引起的问题。我们将该方法应用于斯洛文尼亚传记词典的案例,并在新开发的 51 篇斯洛文尼亚传记金标准数据集上评估。我们的缩写识别方法显著优于常用临时方案,尤其在识别未见缩写方面。我们还提出并展示了一种在上下文中展开所识别缩写的方法及其结果。

关键词

引用

@article{arxiv.2211.02429,
  title  = {Dealing with Abbreviations in the Slovenian Biographical Lexicon},
  author = {Angel Daza and Antske Fokkens and Tomaž Erjavec},
  journal= {arXiv preprint arXiv:2211.02429},
  year   = {2022}
}

备注

To be presented at The 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP 2022)