CHisIEC:一个面向中国古代史的信息抽取语料库
计算与语言
2024-04-23 v2
摘要
自然语言处理(NLP)在数字人文(DH)领域发挥着关键作用,是推进历史和文化遗产文本结构化分析的基石,在命名实体识别(NER)和关系抽取(RE)领域尤其如此。为加速古代历史文化研究,我们推出了“中国历史信息抽取语料库”(CHisIEC)。CHisIEC 是一个精心构建的数据集,旨在开发和评估 NER 与 RE 任务,为该领域研究提供资源。该数据集跨越了非凡的历史时间线,涵盖来自 13 个朝代、超过 1830 年的数据,集中体现了中国历史文献广泛的时空跨度和文本异质性。数据集包含四种不同的实体类型和十二种关系类型,形成了一个包含 14,194 个实体和 8,609 个关系的精细标注数据集。为验证数据集的稳健性和通用性,我们使用不同规模和范式的模型进行了全面实验。此外,我们还评估了大型语言模型(LLMs)在处理中国古代史相关任务时的能力。数据集和代码可在 \url{https://github.com/tangxuemei1995/CHisIEC} 获取。
引用
@article{arxiv.2403.15088,
title = {CHisIEC: An Information Extraction Corpus for Ancient Chinese History},
author = {Xuemei Tang and Zekun Deng and Qi Su and Hao Yang and Jun Wang},
journal= {arXiv preprint arXiv:2403.15088},
year = {2024}
}
备注
11 pages, 6 tables, 3 figures