中文

关注要处:以选择性区域聚焦重新思考视觉文档理解

计算机视觉与模式识别 2023-09-06 v1 计算与语言

摘要

我们提出一种名为 SeRum(SElective Region Understanding Model,选择性区域理解模型)的新型端到端文档理解模型,用于从文档图像中提取有意义的信息,包括文档分析、检索和办公自动化。与依赖多阶段技术方案且计算昂贵的现有最优方法不同,SeRum 利用内容感知的 token 合并模块,将文档图像理解与识别任务转化为感兴趣视觉 token 的局部解码过程。该机制使模型能更多关注由查询解码器生成的感兴趣区域,提升模型有效性并加速生成式方案的解码速度。我们还设计了若干预训练任务以增强模型的局部感知与理解能力。实验结果表明,SeRum 在文档理解任务上达到 SOTA 性能,在文本检测识别(text spotting)任务上取得有竞争力的结果。SeRum 向着高效且有效的端到端文档理解迈出了重要一步。

关键词

引用

@article{arxiv.2309.01131,
  title  = {Attention Where It Matters: Rethinking Visual Document Understanding with Selective Region Concentration},
  author = {Haoyu Cao and Changcun Bao and Chaohu Liu and Huang Chen and Kun Yin and Hao Liu and Yinsong Liu and Deqiang Jiang and Xing Sun},
  journal= {arXiv preprint arXiv:2309.01131},
  year   = {2023}
}

备注

Accepted to ICCV 2023 main conference