跨越数个世纪的迁移学习:机器与历史学家融合方法解读承政院日记
计算与语言
2023-06-27 v1 数字图书馆
摘要
命名实体识别与分类在捕获数据语义、锚定翻译及历史下游研究中起着首要且至关重要的作用。然而,历史文本中的NER面临诸多挑战,如标注语料稀缺、多语言多样性、各种噪声以及与当代语言模型迥异的惯例。本文介绍了记录数个世纪、近期由历史学家细致标注了命名实体信息及短语标记朝鲜历史语料《承政院日记》(SeungJeongWon)。我们在历史语料上微调语言模型,使用我们的语言模型与预训练多语言模型进行了广泛的对比实验。我们提出时间与标注信息结合的假设,并基于统计t检验进行了验证。我们的发现表明,短语标记显著提升了NER模型在预测写于远不同时期的文档中未见实体时的性能;同时显示,单独的短语标记与语料特定的训练模型均不能改善性能。我们讨论了未来研究方向及解读历史文献的实用策略。
引用
@article{arxiv.2306.14592,
title = {Transfer Learning across Several Centuries: Machine and Historian Integrated Method to Decipher Royal Secretary's Diary},
author = {Sojung Lucia Kim and Taehong Jang and Joonmo Ahn and Hyungil Lee and Jaehyuk Lee},
journal= {arXiv preprint arXiv:2306.14592},
year = {2023}
}
备注
7 pages, 9 figures