DocLangID:改进少样本训练以识别历史文档的语言
计算机视觉与模式识别
2023-09-19 v1
摘要
语言识别描述了识别文档中书面文本语言的任务。该信息至关重要,因为它可用于支持对文档词汇和上下文的分析。近年来,监督学习方法推进了语言识别任务。然而,这些方法通常需要大型标注数据集,而对于各种图像领域(如文档或场景图像)往往并不具备。在本工作中,我们提出 DocLangID,一种用于识别未标注历史文档语言的迁移学习方法。我们首先利用来自不同但相关的历史文档领域的标注数据来实现这一点。其次,我们实现一种基于距离的少样本学习方法,使卷积神经网络适应未标注数据集的新语言。通过从未标注图像集中引入少量人工标注样本,我们的特征提取器对历史文档的新异数据分布产生了更好的适应性。我们展示了这样的模型可以仅通过复用相同的少样本样本对未标注图像集进行有效微调。我们在主要使用拉丁字母的 10 种语言上展示了我们的工作。我们在历史文档上的实验表明,我们的组合方法提升了语言识别性能,在未标注数据集的四种未见语言上达到了 74% 的识别准确率。
引用
@article{arxiv.2305.02208,
title = {DocLangID: Improving Few-Shot Training to Identify the Language of Historical Documents},
author = {Furkan Simsek and Brian Pfitzmann and Hendrik Raetz and Jona Otholt and Haojin Yang and Christoph Meinel},
journal= {arXiv preprint arXiv:2305.02208},
year = {2023}
}
备注
6 pages (including references and excluding appendix)