中文

基于Transformer的UNet结合多头交叉注意力跳跃连接以消除扫描文档中的伪影

计算机视觉与模式识别 2023-06-06 v1 机器学习

摘要

高质量文本提取对于文档分类或命名实体识别等基于文本的文档分析任务至关重要。遗憾的是,这并非总能得到保证,因为扫描质量差及由此产生的伪影会导致光学字符识别(OCR)过程中的错误。当前使用卷积神经网络的方法在背景去除任务上展现出有前景的结果,但无法校正像素化或压缩错误等伪影。对于通用图像,Transformer骨干正愈发频繁地集成到去噪任务中知名神经网络结构里。本工作提出一种使用Swin Transformer骨干的改进UNet结构,以去除扫描文档中的典型伪影。采用多头交叉注意力跳跃连接,以更有选择性地学习各抽象层级的特征。该方法在压缩错误、像素化和随机噪声方面的性能得到考察。在合成数据上文本提取质量得到提升,错误率降低达53.9%。预训练基础模型可轻松适配新伪影。交叉注意力跳跃连接允许集成从编码器提取的文本信息或以指令形式更有选择性地控制模型输出。后者通过一个示例应用予以展示。

关键词

引用

@article{arxiv.2306.02815,
  title  = {Transformer-Based UNet with Multi-Headed Cross-Attention Skip Connections to Eliminate Artifacts in Scanned Documents},
  author = {David Kreuzer and Michael Munz},
  journal= {arXiv preprint arXiv:2306.02815},
  year   = {2023}
}