FEWS:基于词典的大规模少样本词义消歧
计算与语言
2021-02-17 v1
摘要
当前的词义消歧(WSD)模型难以消歧罕见词义,尽管其在全局 WSD 指标上已达到人类水平。这源于现有 WSD 数据集中缺乏用于建模和评估罕见词义的数据。在本文中,我们引入 FEWS(Few-shot Examples of Word Senses),一个从 Wiktionary 的例句中自动提取的新型少样本 WSD 数据集。FEWS 在不同自然语言领域具有高的词义覆盖度,并提供:(1)一个覆盖比先前数据集多得多词义的大型训练集;(2)一个包含多种词义的少样本与零样本示例的综合评估集。我们基于知识型和神经 WSD 方法在 FEWS 上建立基线,并给出迁移学习实验,表明额外使用 FEWS 训练的模型能更好地捕捉现有 WSD 数据集中的罕见词义。最后,我们发现人类在 FEWS 上优于最佳基线模型,表明 FEWS 将支持未来在少样本 WSD 上的重要工作。
引用
@article{arxiv.2102.07983,
title = {FEWS: Large-Scale, Low-Shot Word Sense Disambiguation with the Dictionary},
author = {Terra Blevins and Mandar Joshi and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2102.07983},
year = {2021}
}
备注
EACL 2021