面向含OCR错误的历史文本的数据中心化领域自适应
计算与语言
2021-07-05 v1 机器学习
摘要
我们提出针对荷兰语与法语历史数据的域内与跨域命名实体识别(NER)新方法。对于跨域情形,我们通过上下文字符串嵌入整合无监督域内数据以应对领域偏移,并向源域注入合成OCR错误及处理数据中心化领域自适应以应对OCR错误。我们提出一种在任意输入数据中模拟OCR错误的通用方法。我们的跨域与域内结果均优于若干强基线并确立了最先进(SOTA)结果。我们发布了法语与荷兰语Europeana NER语料的预处理版本。
引用
@article{arxiv.2107.00927,
title = {Data Centric Domain Adaptation for Historical Text with OCR Errors},
author = {Luisa März and Stefan Schweter and Nina Poerner and Benjamin Roth and Hinrich Schütze},
journal= {arXiv preprint arXiv:2107.00927},
year = {2021}
}
备注
14 pages, 2 figures, 6 tables