中文

面向文档级关系抽取的模块化自监督方法

计算与语言 2021-09-14 v1

摘要

跨大文本跨度的关系抽取在 NLP 中相对未被充分探索,但对于生物医学等具有高价值的领域尤为关键,因为在实际应用中获取最新发现的高召回率至关重要。相较于局限于短文本跨度的传统信息抽取,文档级关系抽取在推理与学习两方面均面临额外挑战。给定更长文本跨度,最先进的神经架构效力下降,且诸如远程监督之类的任务特定自监督变得非常嘈杂。本文中,受戴维森语义学启发,我们提出将文档级关系抽取分解为关系检测与论元解析。这使我们能够引入显式语篇建模,并为每个子问题利用模块化自监督,其不易受噪声影响,并可通过变分 EM 端到端进一步优化。我们在面向精准肿瘤学的生物医学机器阅读中进行了详尽评估,其中跨段落关系提及十分普遍。我们的方法以超过 20 个绝对 F1 点的优势优于先前的 SOTA,如多尺度学习与图神经网络。这一提升在最具挑战性、论元从未同现于一段中的关系实例上尤为显著。

关键词

引用

@article{arxiv.2109.05362,
  title  = {Modular Self-Supervision for Document-Level Relation Extraction},
  author = {Sheng Zhang and Cliff Wong and Naoto Usuyama and Sarthak Jain and Tristan Naumann and Hoifung Poon},
  journal= {arXiv preprint arXiv:2109.05362},
  year   = {2021}
}

备注

EMNLP 2021