中文

DetIE:受目标检测启发 multilingual 开放信息抽取方法

计算与语言 2022-06-28 v1

摘要

最先进的开放信息抽取(OpenIE)神经方法通常以自回归或基于谓词的方式迭代抽取三元组(或元组),以避免产生重复。在本工作中,我们提出了一种不同的问题处理思路,其可取得同等或更好的效果。具体而言,我们提出了一种受计算机视觉中目标检测算法启发的新型单遍 OpenIE 方法。我们使用基于二分匹配的顺序无关损失来强制唯一预测,并采用基于 Transformer 的仅编码器架构进行序列标注。所提方法更快,且在标准基准上相较最先进模型在质量指标和推理时间方面均表现出更优或相似的性能。我们的模型在按 OIE2016 评估的 CaRB 上以 67.7% F1 刷新了最先进性能,同时推理速度比先前最先进模型快 3.35 倍。我们还在零样本设定下评估了模型的多语言版本(涵盖两种语言),并引入了一种生成合成多语言数据以针对每种特定语言微调模型的策略。在此设定下,我们在多语言 Re-OIE2016 上显示出 15% 的性能提升,葡萄牙语和西班牙语均达到 75% F1。代码与模型可在 https://github.com/sberbank-ai/DetIE 获取。

关键词

引用

@article{arxiv.2206.12514,
  title  = {DetIE: Multilingual Open Information Extraction Inspired by Object Detection},
  author = {Michael Vasilkovsky and Anton Alekseev and Valentin Malykh and Ilya Shenbin and Elena Tutubalina and Dmitriy Salikhov and Mikhail Stepnov and Andrey Chertok and Sergey Nikolenko},
  journal= {arXiv preprint arXiv:2206.12514},
  year   = {2022}
}

备注

Accepted to the Thirty-Sixth AAAI Conference on Artificial Intelligence (AAAI-22)