中文

SynSetExpan:实体集扩展与同义词发现联合迭代框架

计算与语言 2020-09-30 v1 人工智能

摘要

实体集扩展与同义词发现是两个关键 NLP 任务。以往研究分别完成二者,未探索其相互依赖关系。本文假设这两类任务紧密耦合,因为两个同义实体往往属于各类语义类的似然相近。这促使我们设计 SynSetExpan——一种使两任务相互增强的新型框架。SynSetExpan 使用同义词发现模型将流行实体的低频同义词纳入集合,从而提升集扩展召回率。同时,能判定实体是否属于某语义类的集扩展模型可生成伪训练数据,以微调同义词发现模型从而获得更优准确率。为助力研究两任务交互,我们通过众包创建了首个大规模同义词增强集扩展(SE2)数据集。在 SE2 数据集与以往基准上的大量实验证明了 SynSetExpan 在实体集扩展与同义词发现任务上的有效性。

关键词

引用

@article{arxiv.2009.13827,
  title  = {SynSetExpan: An Iterative Framework for Joint Entity Set Expansion and Synonym Discovery},
  author = {Jiaming Shen and Wenda Qiu and Jingbo Shang and Michelle Vanni and Xiang Ren and Jiawei Han},
  journal= {arXiv preprint arXiv:2009.13827},
  year   = {2020}
}

备注

EMNLP 2020