PDNet:融合原始对偶网络的语义分割用于文档二值化
机器学习
2018-05-18 v3 机器学习
摘要
数字文档的二值化任务是将文档图像中的每个像素分类为属于背景(羊皮纸/纸张)或前景(文本/墨水)。历史文档常遭受退化影响,使该任务具有挑战性。在当前工作中,提出了一种深度神经网络架构,其将全卷积网络与展开的原始对偶网络相结合,可端到端训练,在七个数据集中有四个上实现了最先进的二值化。文档二值化被表述为能量最小化问题。训练一个全卷积神经网络用于像素的语义分割,提供与每个像素相关的标注代价。该代价估计沿边缘被细化,以使用原始对偶方法补偿前景类的任何过高或过低估计。我们提供了关于近端算子的必要概述,以促进训练原始对偶网络所需的理论基础(使用梯度下降算法)。处理了由于原始对偶方法的递归性质而遇到的数值不稳定性。我们提供了在文档二值化竞赛数据集上的实验结果,以及网络改动和超参数调优(为网络的稳定性和性能所需)。根据竞赛指标,该网络在合成数据集上预训练时表现更好。
引用
@article{arxiv.1801.08694,
title = {PDNet: Semantic Segmentation integrated with a Primal-Dual Network for Document binarization},
author = {Kalyan Ram Ayyalasomayajula and Filip Malmberg and Anders Brun},
journal= {arXiv preprint arXiv:1801.08694},
year = {2018}
}
备注
Under consideration for Pattern Recognition Letters Special Issue on Graphonomics for e-citizens: e-health, e-society, e-education 11 pages, 10 figures, 2 tables