使用Dessurt的端到端文档识别与理解
计算机视觉与模式识别
2022-06-17 v3
摘要
我们介绍Dessurt,一个相对简单的文档理解transformer,能够比先前方法在更多样的文档任务上微调。它接收文档图像和任务字符串作为输入,并自回归地生成任意文本作为输出。由于Dessurt是除文档理解外还执行文本识别的端到端架构,它不需要像先前方法那样依赖外部识别模型。Dessurt是比先前方法更灵活的模型,能够处理多种文档域与任务。我们展示该模型在9种不同的数据集-任务组合上有效。
引用
@article{arxiv.2203.16618,
title = {End-to-end Document Recognition and Understanding with Dessurt},
author = {Brian Davis and Bryan Morse and Bryan Price and Chris Tensmeyer and Curtis Wigington and Vlad Morariu},
journal= {arXiv preprint arXiv:2203.16618},
year = {2022}
}