先看后答:利用视觉定位增强关键信息提取
计算机视觉与模式识别
2025-08-29 v2 人工智能
摘要
在数字时代,理解融合文本、复杂布局和图像的视觉富文档的能力至关重要。传统的关键信息提取(KIE)方法主要依赖光学字符识别(OCR),这通常会引入显著的延迟、计算开销和错误。当前先进的图像到文本方法绕过了OCR,但通常只生成纯文本输出,缺乏相应的视觉定位。在本文中,我们提出了STNet(先看后答网络),这是一种新颖的端到端模型,旨在提供精确答案并附带相关的视觉定位。其独特之处在于,STNet利用一个特殊的<see>标记来观察相关的图像区域,并由一个解码器辅助解释与该标记关联的物理坐标。该<see>标记位于答案文本的开头,使模型能够先“看”——观察与输入问题相关的图像区域——然后“答”——提供清晰的文本回答。为了增强模型的“看”能力,我们收集了广泛的结构化表格识别数据集。利用GPT-4先进的文本处理能力,我们开发了TVG(带视觉定位的表格问答)数据集,该数据集不仅提供基于文本的问答对,还包含了这些问答对的精确视觉定位。我们的方法在KIE性能上取得了实质性进展,在CORD、SROIE和DocVQA等公开数据集上达到了最先进的结果。代码也将公开。
引用
@article{arxiv.2409.19573,
title = {See then Tell: Enhancing Key Information Extraction with Vision Grounding},
author = {Shuhang Liu and Zhenrong Zhang and Pengfei Hu and Jiefeng Ma and Jun Du and Qing Wang and Jianshu Zhang and Chenyu Liu},
journal= {arXiv preprint arXiv:2409.19573},
year = {2025}
}