中文

面向不同标注层级文档级关系抽取的统一正-未标注学习框架

计算与语言 2022-10-25 v2 人工智能

摘要

文档级关系抽取(RE)旨在识别跨多个句子的实体间关系。以往多数方法聚焦于全监督下的文档级 RE。然而,在真实场景中,由于文档级 RE 中实体对数量随实体数量呈二次增长,完整标注文档中所有关系昂贵且困难。为解决常见的不完全标注问题,我们提出统一的正-未标注学习框架——偏移与平方排序损失正-未标注(SSR-PU)学习。我们首次将正-未标注(PU)学习用于文档级 RE。考虑到数据集的标注数据可能导致未标注数据的先验偏移,我们引入训练数据先验偏移下的 PU 学习。此外,利用 none 类得分作为自适应阈值,我们提出平方排序损失并证明其相对于多标签排序度量的贝叶斯一致性。大量实验表明,我们的方法相对于先前不完全标注基线取得了约 14 个 F1 点的提升。此外,其在全监督与极度未标注设置下均优于以往最优结果。

关键词

引用

@article{arxiv.2210.08709,
  title  = {A Unified Positive-Unlabeled Learning Framework for Document-Level Relation Extraction with Different Levels of Labeling},
  author = {Ye Wang and Xinxin Liu and Wenxin Hu and Tao Zhang},
  journal= {arXiv preprint arXiv:2210.08709},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 Main Conference