中文

Mirror:一种面向多种信息抽取任务的通用框架

计算与语言 2023-11-28 v2 人工智能

摘要

由于数据格式多样和任务差异,信息抽取(IE)任务间的知识共享一直是一项挑战。同时,这种分歧导致信息浪费,并增加了在真实场景中构建复杂应用的难度。近期研究常将 IE 任务表述为三元组抽取问题。然而,此类范式不支持多片段和多元抽取,导致通用性较弱。为此,我们将 IE 问题重组为统一的多槽位元组,并提出一种面向多种 IE 任务的通用框架,即 Mirror。具体而言,我们将现有 IE 任务重新定义为多片段循环图抽取问题,并设计了一种非自回归图解码算法,在单步内抽取所有片段。值得注意的是,该图结构极具通用性,不仅支持复杂 IE 任务,也支持机器阅读理解与分类任务。我们手动构建了一个包含 57 个数据集的语料库用于模型预训练,并在 8 类下游任务的 30 个数据集上开展实验。实验结果表明,我们的模型具有良好的兼容性,并在少样本和零样本设定下优于或与 SOTA 系统取得相当性能。代码、模型权重及预训练语料发布于 https://github.com/Spico197/Mirror 。

关键词

引用

@article{arxiv.2311.05419,
  title  = {Mirror: A Universal Framework for Various Information Extraction Tasks},
  author = {Tong Zhu and Junfei Ren and Zijian Yu and Mengsong Wu and Guoliang Zhang and Xiaoye Qu and Wenliang Chen and Zhefeng Wang and Baoxing Huai and Min Zhang},
  journal= {arXiv preprint arXiv:2311.05419},
  year   = {2023}
}

备注

Accepted to EMNLP23 main conference