关注要处:以选择性区域聚焦重新思考视觉文档理解
计算机视觉与模式识别
2023-09-06 v1 计算与语言
摘要
我们提出一种名为 SeRum(SElective Region Understanding Model,选择性区域理解模型)的新型端到端文档理解模型,用于从文档图像中提取有意义的信息,包括文档分析、检索和办公自动化。与依赖多阶段技术方案且计算昂贵的现有最优方法不同,SeRum 利用内容感知的 token 合并模块,将文档图像理解与识别任务转化为感兴趣视觉 token 的局部解码过程。该机制使模型能更多关注由查询解码器生成的感兴趣区域,提升模型有效性并加速生成式方案的解码速度。我们还设计了若干预训练任务以增强模型的局部感知与理解能力。实验结果表明,SeRum 在文档理解任务上达到 SOTA 性能,在文本检测识别(text spotting)任务上取得有竞争力的结果。SeRum 向着高效且有效的端到端文档理解迈出了重要一步。
引用
@article{arxiv.2309.01131,
title = {Attention Where It Matters: Rethinking Visual Document Understanding with Selective Region Concentration},
author = {Haoyu Cao and Changcun Bao and Chaohu Liu and Huang Chen and Kun Yin and Hao Liu and Yinsong Liu and Deqiang Jiang and Xing Sun},
journal= {arXiv preprint arXiv:2309.01131},
year = {2023}
}
备注
Accepted to ICCV 2023 main conference