中文

从多样数据集集体学习以实现开放环境下的实体类型标注

计算与语言 2021-06-01 v3 人工智能

摘要

实体类型标注(ET)是在句子中为给定实体指称分配标签的问题。现有ET工作需了解给定测试实例的领域与目标标签集。缺乏此类知识的ET是一个新问题,我们将其作为开放环境下的ET来解决。我们假定该问题的解决方案是构建在整体ET任务上泛化更好的监督模型,而非针对特定数据集。在此方向上,我们提出集体学习框架(CLF),其能以统一方式从多样数据集中学习。CLF首先通过聚合所有可用数据集的标签信息创建统一层次标签集(UHLS)与标签映射。随后它利用UHLS、标签映射及部分损失函数构建单一神经网络分类器。该单一分类器可预测跨所有可用领域的最细粒度可能标签,即便这些标签未出现于任何领域特定数据集中。我们还提出一组评估方案与指标,以评估模型在此新问题上的表现。在七个多样真实世界数据集上的大量实验证明了我们CLF的有效性。

关键词

引用

@article{arxiv.1810.08782,
  title  = {Collective Learning From Diverse Datasets for Entity Typing in the Wild},
  author = {Abhishek Abhishek and Amar Prakash Azad and Balaji Ganesan and Ashish Anand and Amit Awekar},
  journal= {arXiv preprint arXiv:1810.08782},
  year   = {2021}
}

备注

Accepted at EYRE'19 Workshop, CIKM 2019