利用词义注记增强的双编码器深入解决词义消歧长尾问题
计算与语言
2020-06-03 v2
摘要
词义消歧(WSD)中的一个主要障碍是词义词项分布不均,导致现有模型通常在训练期间罕见或未见过的义项上表现较差。我们提出一种双编码器模型,独立嵌入(1)带其周围上下文的目标词,以及(2)每个义项的词典定义或词义注记(gloss)。编码器在同一表示空间中联合优化,从而可通过为每个目标词嵌入寻找最近的义项嵌入来进行义项消歧。我们的系统在英文全词WSD上优于先前最先进(state-of-the-art)模型;这些提升主要来自罕见义项性能的改善,相较于先前工作,在较少频率义项上实现了31.1%的误差降低。这表明罕见义项可通过建模其定义得到更有效的消歧。
引用
@article{arxiv.2005.02590,
title = {Moving Down the Long Tail of Word Sense Disambiguation with Gloss-Informed Biencoders},
author = {Terra Blevins and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2005.02590},
year = {2020}
}
备注
Accepted to ACL 2020; current version corrects typos and formatting