Better Call the Plumber:动态信息抽取流水线的编排
计算与语言
2021-02-23 v1 信息检索
摘要
在过去十年中,大量知识图谱(KG)信息抽取方法被提出。尽管有效,这些工作彼此 disjoint,且它们在有效 KG 信息抽取(IE)中的集体优势与弱点尚未在文献中被研究。我们提出 Plumber,首个将研究界 disjoint 的 IE 工作汇集在一起的框架。Plumber 架构包含 33 个可复用的组件,用于各种 KG 信息抽取子任务,如共指消解、实体链接和关系抽取。利用这些组件,Plumber 动态生成合适的信息抽取流水线,并提供总计 264 条不同的流水线。我们研究基于输入句子选择合适流水线的优化问题。为此,我们训练了一个基于 transformer 的分类模型,从输入中提取上下文嵌入并找到合适的流水线。我们使用标准数据集在两个 KG 上研究 Plumber 抽取 KG 三元组的效能:DBpedia 和 Open Research Knowledge Graph(ORKG)。我们的结果证明了 Plumber 在动态生成 KG 信息抽取流水线方面的有效性,优于所有与底层 KG 无关的基线。此外,我们提供了对集体失败案例的分析,研究了集成组件之间的相似性与协同作用,并讨论了它们的局限性。
引用
@article{arxiv.2102.10966,
title = {Better Call the Plumber: Orchestrating Dynamic Information Extraction Pipelines},
author = {Mohamad Yaser Jaradeh and Kuldeep Singh and Markus Stocker and Andreas Both and Sören Auer},
journal= {arXiv preprint arXiv:2102.10966},
year = {2021}
}
备注
Accepted in ICWE 2021