层次化损失与新资源用于细粒度实体 typing 与链接
计算与语言
2018-07-16 v1
摘要
从原始文本抽取到含实体与细粒度类型的知识库通常被视作向扁平的实体与类型标签集合进行预测,忽视了精选本体中所包含的类型与实体上的丰富层次结构。先前融合层次结构的尝试收效甚微,且局限于浅层本体。本文提出使用实值与复值双线性映射来整合层次信息的新方法,在实体链接与细粒度实体分类上相较扁平预测取得显著提升,并在基准 FIGER 数据集上达到端到端模型的新 SOTA 结果。我们还提出两个新的人工标注数据集,包含宽广且深层的结构,将向社区发布以推动该方向进一步研究:MedMentions,一组 PubMed 摘要,其中 246k 处提及已映射到庞大的 UMLS 本体;以及 TypeNet,将 Freebase 类型与 WordNet 层次对齐以获得近 2k 个实体类型。在全部三个数据集上的实验表明,感知层次的训练带来了实质性增益。
引用
@article{arxiv.1807.05127,
title = {Hierarchical Losses and New Resources for Fine-grained Entity Typing and Linking},
author = {Shikhar Murty* and Patrick Verga* and Luke Vilnis and Irena Radovanovic and Andrew McCallum},
journal= {arXiv preprint arXiv:1807.05127},
year = {2018}
}
备注
ACL 2018