通过自动化实体识别打破殖民档案的沉默
数字图书馆
2022-10-06 v1
摘要
殖民档案因包含历史上被边缘化人群的痕迹,正受到来自多种视角的日益关注。不幸的是,与大多数档案一样,由于持续存在的重大障碍,它们仍然难以获取。我们在此关注其中之一:历史检索工具(如至今仍在使用的个人姓名索引)中存在的偏见。在殖民档案中,索引可能通过遗漏对历史上被边缘化者的提及而延续沉默。为克服此类局限并拓宽现有检索工具的范围,我们提出使用自动化实体识别。为此,我们贡献了一种适用目的的标注类型体系,并将其应用于荷兰东印度公司(VOC)的殖民档案。我们发布了一个包含近 70,000 条标注的语料库作为共享任务,并基于最先进的神经网络模型提供了基线。我们的工作旨在激励更多朝着拓宽(殖民)档案获取途径的贡献,将自动化作为实现此目标的一种可能手段。
引用
@article{arxiv.2210.02194,
title = {Unsilencing Colonial Archives via Automated Entity Recognition},
author = {Mrinalini Luthra and Konstantin Todorov and Charles Jeurgens and Giovanni Colavizza},
journal= {arXiv preprint arXiv:2210.02194},
year = {2022}
}