中文

ADBCMM:通过构建反事实与多语言混合进行缩略词消歧

计算与语言 2022-02-08 v2 人工智能

摘要

科学文献通常包含大量缩略词。对这些缩略词进行消歧将有助于研究人员更好地理解文献中词汇的含义。过去,得益于来自英文文献的大量数据,缩略词任务主要应用于英文文献。然而,对于其他低资源语言,由于缺乏大量标注数据,该任务难以获得良好的性能且受到较少关注。为了解决上述问题,本文提出了一种新的缩略词消歧方法,命名为 ADBCMM,该方法可以通过构建反事实和多语言混合显著提高低资源语言的性能。具体而言,通过平衡低资源语言中的数据偏差,ADBCMM 能够提高数据集之外的测试性能。在 SDU@AAAI-22 - 共享任务 2:缩略词消歧中,所提出的方法在法语和西班牙语中获得了第一名。您可以在此处重复我们的结果 https://github.com/WENGSYX/ADBCMM。

关键词

引用

@article{arxiv.2112.08991,
  title  = {ADBCMM : Acronym Disambiguation by Building Counterfactuals and Multilingual Mixing},
  author = {Yixuan Weng and Fei Xia and Bin Li and Xiusheng Huang and Shizhu He},
  journal= {arXiv preprint arXiv:2112.08991},
  year   = {2022}
}

备注

SDU@AAAI-2022