基于字符级嵌入与多阶段注意力U-Net的端到端信息抽取
计算机视觉与模式识别
2021-09-10 v3 机器学习
图像与视频处理
摘要
由于需要将大量非结构化文档(如发票、收据、银行转账单等)数字化的需求,从文档图像中抽取信息近期受到广泛关注。本文中,我们提出了一种用于文档二维字符网格嵌入上端到端信息抽取的新型深度学习架构,即\textit{多阶段注意力U-Net}(Multi-Stage Attentional U-Net)。为有效捕捉二维元素间的文本与空间关系,我们的模型利用了专门的多阶段编码器-解码器设计,并结合自注意力机制与框卷积的高效使用。在不同数据集上的实验结果表明,我们的模型以少40%的参数大幅优于基线U-Net架构。此外,它还在OCR错误和有限训练数据场景下显著改进了基线,从而适用于真实世界应用。
引用
@article{arxiv.2106.00952,
title = {End-to-End Information Extraction by Character-Level Embedding and Multi-Stage Attentional U-Net},
author = {Tuan-Anh Nguyen Dang and Dat-Thanh Nguyen},
journal= {arXiv preprint arXiv:2106.00952},
year = {2021}
}
备注
Accepted to BMVC 2019