中文

基于预算感知黑盒近似的文档图像清洗

计算机视觉与模式识别 2023-06-26 v1

摘要

近期研究表明,通过使用神经网络近似不可微黑盒函数的行为,可将黑盒集成到可微训练流程中实现端到端训练。该方法被称为“可微旁路”,其成功应用之一为训练文档预处理器以提升黑盒 OCR 引擎的性能。然而,对 OCR 引擎的良好近似需要在整个训练过程中对所有样本进行查询,这在计算和经费上均代价高昂。黑盒攻击文献中提出了若干零阶优化(ZO)算法,以查询高效的方式计算黑盒模型的梯度来寻找对抗样本。但此类算法的查询复杂度和收敛速率使其难以用于我们的问题。本工作中,我们提出两种样本选择算法,以少于原始系统 OCR 引擎查询量 10% 的代价训练 OCR 预处理器,在精度无显著损失的前提下将总训练时间减少逾 60%。我们还展示了仅用总查询量的 2.5% 和 32 倍经费削减,便使某商业 OCR 引擎的词级精度提升 4%。此外,我们提出一种简单的排序技术,可从训练数据集中剪除 30% 的文档图像而不影响系统性能。

关键词

引用

@article{arxiv.2306.13236,
  title  = {Document Image Cleaning using Budget-Aware Black-Box Approximation},
  author = {Ganesh Tata and Katyani Singh and Eric Van Oeveren and Nilanjan Ray},
  journal= {arXiv preprint arXiv:2306.13236},
  year   = {2023}
}