利用掩码语言模型的弱监督进行超细粒度实体类型标注
计算与语言
2021-06-09 v1
摘要
近来,学界致力于通过使用更丰富且超细粒度的类型集合,并对包括代词和名词性名词在内的名词短语而非仅命名实体指称进行标注,来扩展细粒度实体类型标注。该超细粒度实体类型标注任务的一个关键挑战在于人工标注数据极其稀缺,且现有远程或弱监督方法的标注能力非常有限。为弥补这一问题,本文中我们提出通过使用 BERT 掩码语言模型(MLM)来获取超细粒度实体类型标注的训练数据。给定句子中的一个指称,我们的方法为 BERT MLM 构造一个输入,使其预测该指称的上下文相关上位词,这些上位词可用作类型标签。实验结果表明,在这些自动生成标签的帮助下,超细粒度实体类型标注模型的性能可得到显著提升。我们还展示了在经过简单的类型映射后,我们的方法可用于改进传统的细粒度实体类型标注。
引用
@article{arxiv.2106.04098,
title = {Ultra-Fine Entity Typing with Weak Supervision from a Masked Language Model},
author = {Hongliang Dai and Yangqiu Song and Haixun Wang},
journal= {arXiv preprint arXiv:2106.04098},
year = {2021}
}
备注
ACL 2021