中文

HUE:用于理解古韩国汉字文献的预训练模型与数据集

计算与语言 2022-10-12 v1

摘要

20 世纪以前的韩国历史记录主要以汉字书写,这是一种基于汉字的已消亡语言,现代韩语或汉语使用者无法理解。具有该时期专业背景的历史学家一直在分析这些文献,但该过程非常困难且耗时,而语言模型将显著加快这一过程。为了构建和评估汉字语言模型,我们发布了汉字理解评估数据集,包含年代归属、主题分类、命名实体识别和摘要检索任务。我们还提出了基于 BERT 的模型,并在 14 至 19 世纪的两大语料库上进行了持续训练:朝鲜王朝实录和承政院日记。我们在所有任务上将这些模型与几个基线进行了比较,结果表明在这两个语料库上进行训练带来了显著的改进。此外,我们在《王室及重要官员日常记录》(DRRI) 上进行了零样本实验。历史学家对 DRRI 数据集的研究不多,而 NLP 领域则完全未对其进行过研究。

关键词

引用

@article{arxiv.2210.05112,
  title  = {HUE: Pretrained Model and Dataset for Understanding Hanja Documents of Ancient Korea},
  author = {Haneul Yoo and Jiho Jin and Juhee Son and JinYeong Bak and Kyunghyun Cho and Alice Oh},
  journal= {arXiv preprint arXiv:2210.05112},
  year   = {2022}
}

备注

Findings of NAACL 2022