基于预算感知黑盒近似的文档图像清洗
计算机视觉与模式识别
2023-06-26 v1
摘要
近期研究表明,通过使用神经网络近似不可微黑盒函数的行为,可将黑盒集成到可微训练流程中实现端到端训练。该方法被称为“可微旁路”,其成功应用之一为训练文档预处理器以提升黑盒 OCR 引擎的性能。然而,对 OCR 引擎的良好近似需要在整个训练过程中对所有样本进行查询,这在计算和经费上均代价高昂。黑盒攻击文献中提出了若干零阶优化(ZO)算法,以查询高效的方式计算黑盒模型的梯度来寻找对抗样本。但此类算法的查询复杂度和收敛速率使其难以用于我们的问题。本工作中,我们提出两种样本选择算法,以少于原始系统 OCR 引擎查询量 10% 的代价训练 OCR 预处理器,在精度无显著损失的前提下将总训练时间减少逾 60%。我们还展示了仅用总查询量的 2.5% 和 32 倍经费削减,便使某商业 OCR 引擎的词级精度提升 4%。此外,我们提出一种简单的排序技术,可从训练数据集中剪除 30% 的文档图像而不影响系统性能。
引用
@article{arxiv.2306.13236,
title = {Document Image Cleaning using Budget-Aware Black-Box Approximation},
author = {Ganesh Tata and Katyani Singh and Eric Van Oeveren and Nilanjan Ray},
journal= {arXiv preprint arXiv:2306.13236},
year = {2023}
}