为新 X(X = 语言、领域、体裁)快速构建细粒度实体类型标注系统
计算与语言
2016-03-11 v1 人工智能
摘要
近期研究在细粒度实体类型标注方面取得了重大进展。大多数现有方法需要预定义一组类型,并基于多层次语言特征从大型标注数据集中训练多类分类器。因此它们受限于特定领域、体裁和语言。本文中,我们提出了一种结合符号与分布语义的新型无监督实体类型标注框架。我们首先学习每个实体提及的通用嵌入,利用语言结构组合特定上下文的嵌入,将提及链接到知识库并学习其相关知识表示。然后我们开发了一种新颖的联合层次聚类与链接算法,利用这些表示对所有提及进行类型标注。该框架不依赖任何标注数据、预定义类型模式或手工特征,因此可快速适应新领域、体裁和语言。此外,它在结合语言结构(例如抽象意义表示(AMR)、依存关系)以改进特定上下文表示方面具有极大灵活性。在体裁(新闻与讨论论坛)上的实验显示了与从大量标注数据训练的最先进受监督类型标注系统相当的性能。在各种语言(英语、中文、日语、豪萨语和约鲁巴语)与领域(通用与生物医学)上的结果展示了我们框架的可移植性。
引用
@article{arxiv.1603.03112,
title = {Building a Fine-Grained Entity Typing System Overnight for a New X (X = Language, Domain, Genre)},
author = {Lifu Huang and Jonathan May and Xiaoman Pan and Heng Ji},
journal= {arXiv preprint arXiv:1603.03112},
year = {2016}
}