中文

面向不完全标注文档级关系抽取的阳性-未标注度量学习框架

计算与语言 2024-01-26 v2 人工智能

摘要

文档级关系抽取(RE)的目标是识别跨多个句子的实体间关系。近来,文档级RE中的不完全标注问题受到越来越多的关注,一些研究使用阳性-未标注学习等方法应对该问题,但仍有很大改进空间。受此启发,我们提出一种阳性增强与阳性混合的阳性-未标注度量学习框架(P3M)。具体而言,我们将文档级RE建模为度量学习问题。我们旨在拉近实体对嵌入与其对应关系嵌入间的距离,同时将其推离无关系类的嵌入。此外,我们将阳性-未标注学习适配于该损失目标。为提升模型泛化性,我们使用dropout增强阳性样本,并提出一种阳性-无关系类混合方法。大量实验表明,在不完全标注的文档级RE中,P3M将F1分数提升了约4-10个点,并在完全标注场景下取得state-of-the-art结果。此外,P3M在不完全标注场景下对先验估计偏差也表现出鲁棒性。

关键词

引用

@article{arxiv.2306.14806,
  title  = {A Positive-Unlabeled Metric Learning Framework for Document-Level Relation Extraction with Incomplete Labeling},
  author = {Ye Wang and Huazheng Pan and Tao Zhang and Wen Wu and Wenxin Hu},
  journal= {arXiv preprint arXiv:2306.14806},
  year   = {2024}
}

备注

Accepted by AAAI 2024