中文

面向真实低资源关系抽取:一个带经验基线研究的基准

计算与语言 2023-09-19 v3 人工智能 信息检索 机器学习

摘要

本文提出一项在低资源场景下构建关系抽取系统的实证研究。基于近期的预训练语言模型,我们全面考察了三种用于评估低资源场景下性能的 scheme:(i) 使用少样本标注数据的不同类型基于提示的方法;(ii) 解决长尾分布问题的多种平衡方法;(iii) 数据增强技术与自训练以生成更多领域内标注数据。我们构建了一个包含 8 个关系抽取(RE)数据集的基准,覆盖不同语言、领域与语境,并对所提 scheme 及其组合进行了广泛比较。实验表明:(i) 尽管基于提示的微调在低资源 RE 中是有益的,仍存在较大改进空间,尤其在从含多个关系三元组的跨句语境中抽取关系时;(ii) 平衡方法并非总是有助于长尾分布下的 RE;(iii) 数据增强可补充现有基线并带来显著性能提升,而自训练未必能持续促进低资源 RE。代码与数据集见 https://github.com/zjunlp/LREBench。

关键词

引用

@article{arxiv.2210.10678,
  title  = {Towards Realistic Low-resource Relation Extraction: A Benchmark with Empirical Baseline Study},
  author = {Xin Xu and Xiang Chen and Ningyu Zhang and Xin Xie and Xi Chen and Huajun Chen},
  journal= {arXiv preprint arXiv:2210.10678},
  year   = {2023}
}

备注

Accepted to EMNLP 2022 (Findings) and the project website is https://zjunlp.github.io/project/LREBench/