DiS-ReX:一个用于远程监督关系抽取的多语言数据集
计算与语言
2021-04-20 v1 机器学习
摘要
远程监督(DS)是一种成熟的技术,可在不使用人工标注的情况下创建大规模关系抽取(RE)数据集。然而,DS-RE 的研究大多局限于英语。将 RE 限制为单一语言阻碍了利用其他语言中大量数据的可能,而这些数据本可抽取更多样的事实。最近,一个多语言 DS-RE 数据集被发布。然而,我们的分析显示该数据集呈现出不真实的特性:1)缺乏不表达任何关系的句子;2)给定实体对的所有句子恰好表达一种关系。我们表明这些特性导致对模型性能的严重高估。为此,我们提出一个新数据集 DiS-ReX,以缓解这些问题。我们的数据集包含超过 150 万条句子,覆盖 4 种语言,具有 36 个关系类别 + 1 个无关系(NA)类别。我们还通过用 mBERT 编码句子来修改广泛使用的包注意力模型,并提供了多语言 DS-RE 的首个基准结果。与竞争数据集不同,我们表明我们的数据集具有挑战性,并为该领域未来研究留有充足空间。
引用
@article{arxiv.2104.08655,
title = {DiS-ReX: A Multilingual Dataset for Distantly Supervised Relation Extraction},
author = {Abhyuday Bhartiya and Kartikeya Badola and Mausam},
journal= {arXiv preprint arXiv:2104.08655},
year = {2021}
}