文档图像中的水印文本模式识别
计算机视觉与模式识别
2024-01-12 v2
摘要
在文档图像中进行水印文本识别可以访问一个通常未被探索的信息源,为记录的范围、受众甚至有时为其真实性提供关键证据。源于文本识别问题,检测和理解文档中的水印继承了同样的困难——在自然场景下,文字可能以各种字体、大小和形式出现,使得通用识别成为一个非常困难的问题。为解决该领域资源的匮乏并推动进一步研究,我们提出了一个新颖的基准数据集(K-Watermark),包含使用水印文本模式渲染程序Wrender生成的65,447个数据样本。一项使用人类评分者的有效性研究得出,针对预生成的水印文档,其真实性得分为0.51。为证明该数据集和渲染技术的实用性,我们开发了一个端到端解决方案(Wextract),用于检测水印文本的边界框实例,同时预测所描绘的文本。为处理这一特定任务,我们引入了一种方差最小化损失和一个分层自注意力机制。据我们所知,我们是首个提出用于从文档中检索水印的评估基准和完整解决方案的团队,在检测上超出基线5个AP点,在字符准确率上超出4个点。
引用
@article{arxiv.2401.05167,
title = {Watermark Text Pattern Spotting in Document Images},
author = {Mateusz Krubiński and Stefan Matcovici and Diana Grigore and Daniel Voinea and Alin-Ionut Popa},
journal= {arXiv preprint arXiv:2401.05167},
year = {2024}
}