中文

利用词义注记增强的双编码器深入解决词义消歧长尾问题

计算与语言 2020-06-03 v2

摘要

词义消歧(WSD)中的一个主要障碍是词义词项分布不均,导致现有模型通常在训练期间罕见或未见过的义项上表现较差。我们提出一种双编码器模型,独立嵌入(1)带其周围上下文的目标词,以及(2)每个义项的词典定义或词义注记(gloss)。编码器在同一表示空间中联合优化,从而可通过为每个目标词嵌入寻找最近的义项嵌入来进行义项消歧。我们的系统在英文全词WSD上优于先前最先进(state-of-the-art)模型;这些提升主要来自罕见义项性能的改善,相较于先前工作,在较少频率义项上实现了31.1%的误差降低。这表明罕见义项可通过建模其定义得到更有效的消歧。

关键词

引用

@article{arxiv.2005.02590,
  title  = {Moving Down the Long Tail of Word Sense Disambiguation with Gloss-Informed Biencoders},
  author = {Terra Blevins and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2005.02590},
  year   = {2020}
}

备注

Accepted to ACL 2020; current version corrects typos and formatting