干草堆中的公证人——用 CNN 应对文档处理中的类别不平衡
计算机视觉与模式识别
2020-07-17 v1 图像与视频处理
摘要
公证文书是一类文档。公证文书可通过其公证标志——证书中一个显著的符号——与其他文档区分开来,该标志也可用于识别文档的签发者。自然地,公证文书相对于其他文档而言占比不足。这使得分类变得困难,因为训练数据中的类别不平衡会恶化卷积神经网络(Convolutional Neural Networks, CNN)的性能。在本工作中,我们评估了针对此问题的不同对策。它们被应用于一个中世纪文档集合上的二分类与分割任务。在分类中,公证文书与其他文档区分开,而在分割任务中,公证标志从证书中分离出来。我们评估了不同技术,如数据增强、欠采样与过采样,以及用 focal loss 进行正则化。随机少数类过采样与数据增强的组合带来了最佳性能。在分割中,我们评估了三种损失函数及其组合,其中只有类加权 dice loss 能够充分分割公证标志。
引用
@article{arxiv.2007.07943,
title = {The Notary in the Haystack -- Countering Class Imbalance in Document Processing with CNNs},
author = {Martin Leipert and Georg Vogeler and Mathias Seuret and Andreas Maier and Vincent Christlein},
journal= {arXiv preprint arXiv:2007.07943},
year = {2020}
}
备注
Accepted at DAS Workshop 2020