HistRED:一个历史文档级关系抽取数据集
计算与语言
2023-07-11 v1
摘要
尽管关系抽取(RE)任务在诸多领域有广泛应用,其在历史语境中的探索甚少,而历史语境包含着跨越数百上千年的宝贵数据。为推动历史 RE 研究,我们呈现了基于《燕行录》构建的 HistRED。《燕行录》是一部最初以汉文(古典中文书写)写就、后来被译为韩文的记录合集。HistRED 提供双语标注,从而可在韩文与汉文文本上执行 RE。此外,HistRED 支持从句子级到文档级不同长度的多种自包含子文本,为研究者评估其 RE 模型的鲁棒性提供多样的语境设置。为展示我们数据集的实用性,我们提出一个双语 RE 模型,利用韩文与汉文语境来预测实体间关系。我们的模型在 HistRED 上优于单语基线,表明采用多语言语境可对 RE 预测形成补充。该数据集公开于:https://huggingface.co/datasets/Soyoung/HistRED,采用 CC BY-NC-ND 4.0 许可。
引用
@article{arxiv.2307.04285,
title = {HistRED: A Historical Document-Level Relation Extraction Dataset},
author = {Soyoung Yang and Minseok Choi and Youngwoo Cho and Jaegul Choo},
journal= {arXiv preprint arXiv:2307.04285},
year = {2023}
}