面向跨领域关系抽取的银标句法预训练
计算与语言
2023-05-19 v1
摘要
关系抽取(RE)仍是一项具挑战性的任务,尤其在考虑现实的分布外领域评测时。其主要缘由之一在于当前 RE 数据集训练规模有限:获取高质量(人工标注)数据极其昂贵,且无法针对每个新领域现实地重复进行。在相关任务数据上的中间训练步骤已被证明对众多 NLP 任务有益。然而,该设定仍需要补充标注数据,而后者往往不可得。本文中,我们专门探究面向 RE 的中间预训练。我们利用句法结构与语义 RE 之间的亲和性,并识别出位于两实体间最短依存路径上、与 RE 紧密相关的句法关系。随后,我们借助当前句法解析器的高准确率,自动获取大量低成本的预训练数据。通过在相关句法关系上预训练 RE 模型,我们在六类跨领域设定中的五类上超越基线,且无需任何额外标注数据。
引用
@article{arxiv.2305.11016,
title = {Silver Syntax Pre-training for Cross-Domain Relation Extraction},
author = {Elisa Bassignana and Filip Ginter and Sampo Pyysalo and Rob van der Goot and Barbara Plank},
journal= {arXiv preprint arXiv:2305.11016},
year = {2023}
}
备注
Accepted in Findings of the Association for Computational Linguistics: ACL 2023