BERT 能挖掘吗?——考古学领域信息检索中的命名实体识别
信息检索
2021-06-16 v1 计算与语言
摘要
考古学文献的数量正在迅速增长。直到最近,这些数据仅能通过元数据搜索访问。我们为一个大型考古文本集合(约 百万词)实现了文本检索引擎。在考古学 IR 中,领域特定实体如地点、时期和人工制品起着核心作用。这促使我们开发一个命名实体识别(NER)模型,用考古学命名实体标注整个集合。在本文中,我们提出 ArcheoBERTje,一个在荷兰语考古文本上预训练的 BERT 模型。我们将该模型在命名实体识别任务上的质量和输出与通用多语言模型及通用荷兰语模型进行比较。我们还研究了结合多个 BERT 模型的集成方法,以及使用条件随机场(CRF)将最佳 BERT 模型与领域词表结合的方法。我们发现 ArcheoBERTje 显著优于多语言模型和荷兰语模型,且各次运行间标准偏差更小,达到平均 F1 分数 0.735。该模型也优于组合三个模型的集成方法。将 ArcheoBERTje 预测与来自词表的显式领域知识结合并未提高 F1 分数。我们对 BERT 模型在整个集合上的词汇表和输出进行了定量与定性分析,并提供了关于特定领域微调效果的一些有价值的见解。我们的结果表明,对于如考古学这样的高度特定文本领域,在领域特定数据上的进一步预训练比文献中其他领域所展示的更大程度地提升了模型在 NER 上的质量,并且领域特定预训练使得来自词表的领域知识添加变得不必要。
引用
@article{arxiv.2106.07742,
title = {Can BERT Dig It? -- Named Entity Recognition for Information Retrieval in the Archaeology Domain},
author = {Alex Brandsen and Suzan Verberne and Karsten Lambers and Milco Wansleeben},
journal= {arXiv preprint arXiv:2106.07742},
year = {2021}
}