空缺重建:面向低资源历史文档转写的自监督预训练
计算机视觉与模式识别
2021-12-17 v1 计算与语言
机器学习
摘要
我们提出了一种自监督预训练方法,用于学习面向手写与印刷历史文档转写的丰富视觉语言表示。在两种语言上对预训练编码器表示进行有监督微调以用于低资源文档转写——(1)一组异构的手写伊斯兰手稿图像,(2)早期现代英语印刷文档——之后,我们展示了相较于从零训练的同等有监督模型,在少至 30 个行图像转写用于训练时识别准确率即有显著提升。我们采用的掩码语言模型式预训练策略,训练模型能够从同一行内采样的干扰项中识别真实的掩码视觉表示,这促使学习到对跨文档的书写风格与印刷噪声保持不变的鲁棒上下文语言表示。
引用
@article{arxiv.2112.08692,
title = {Lacuna Reconstruction: Self-supervised Pre-training for Low-Resource Historical Document Transcription},
author = {Nikolai Vogler and Jonathan Parkes Allen and Matthew Thomas Miller and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2112.08692},
year = {2021}
}