DANIEL:面向手写文档信息抽取与标注的快速文档注意力网络
人工智能
2026-02-03 v1
摘要
从手写文档中抽取信息通常涉及三个 distinct 步骤:文档布局分析、手写文字识别和命名实体识别。近期方法尝试将这些步骤集成到单个过程中,使用完全端到端的架构。尽管如此,这些集成方法在应用于纯文本信息抽取时,仍未达到语言模型的性能。本文介绍了 DANIEL(Document Attention Network for Information Extraction and Labelling),一个完全端到端的架构,集成了语言模型,旨在实现全方位的手写文档理解。DANIEL 在全页文档上执行布局识别、手写体识别和命名实体识别。此外,它可以同时跨多个语言、布局和任务进行学习。对于命名实体识别,可通过输入提示指定要应用的本体。该架构采用能够在不调整大小的情况下处理任意尺寸图像的卷积编码器,配合基于变换器语言模型的自回归解码器。DANIEL 在四个数据集上取得竞争成绩,包括在 RIMES 2009 和 M-POPP 上实现了新的最佳性能,在 IAM NER 上取得优异命名实体识别结果。此外,DANIEL 远快于现有方法。我们在 \url{https://github.com/Shulk97/daniel} 上提供了源代码和训练模型的权重。
引用
@article{arxiv.2407.09103,
title = {DANIEL: A fast Document Attention Network for Information Extraction and Labelling of handwritten documents},
author = {Thomas Constum and Pierrick Tranouez and Thierry Paquet},
journal= {arXiv preprint arXiv:2407.09103},
year = {2026}
}