联合识别并修正信息抽取系统不一致抽取结果
计算与语言
2023-01-30 v3
摘要
KGCleaner 是一个用于识别并纠正信息抽取系统产出与交付数据中错误的框架。这些任务此前研究不足,而 KGCleaner 是首个同时解决二者的工作。我们引入了一种多任务模型,联合学习预测抽取关系是否可信,并在不可信时对其进行修复。我们在两个语料上以我们框架的实例评估了我们的方法与其他模型:一个包含近 70 万事实与 500 万事实相关句子的 Wikidata 语料,以及一个来自 2015 年 TAC 知识库填充任务的 3 万事实集合。对于可信性分类,参数高效的简单浅层神经网络在 Wikidata 上可获得 30 个 点的绝对性能提升,在 TAC 上性能相当。对于修复任务,根据数据集与模型性质的不同,可获得显著(两倍以上)的性能提升。
引用
@article{arxiv.1808.04816,
title = {Jointly Identifying and Fixing Inconsistent Readings from Information Extraction Systems},
author = {Ankur Padia and Francis Ferraro and Tim Finin},
journal= {arXiv preprint arXiv:1808.04816},
year = {2023}
}
备注
Accepted at Deep Learning Inside Out (DeeLIO) workshop at ACL 2022