中文

层次化点建模与预训练用于视觉信息提取

计算机视觉与模式识别 2024-11-05 v1

摘要

端到端视觉信息提取 (VIE) 旨在将 VIE 的层次化子任务(包括文本检测、词组聚类和实体标记)集成到统一的框架中。处理这三个子任务之间的差距是设计有效 VIE 模型的关键。依赖 OCR 的方法严重依赖离线 OCR 引擎,不可避免地受到 OCR 错误的影响,而 OCR-free 方法,特别是采用黑箱模型,可能会产生解释性不足或包含幻觉内容的输出。灵感来源于 CenterNet、DeepSolo 和 ESP,我们提出了 HIP,该模型将实体建模为 HIerarchical Points,以更好地符合端到端 VIE 任务的层次化本质。具体而言,这些层次化点可以灵活地编码并随后解码为所需的文本转录、各种区域的中心以及实体的类别。此外,我们设计了相应的层次化预训练策略,包括图像重建、布局学习和语言增强,以强化层次化编码器的跨模态表示。在公共基准数据集上的定量实验表明,HIP 在击破前沿方法的同时,定性结果显示其具有出色的解释性。

关键词

引用

@article{arxiv.2411.01139,
  title  = {HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction},
  author = {Rujiao Long and Pengfei Wang and Zhibo Yang and Cong Yao},
  journal= {arXiv preprint arXiv:2411.01139},
  year   = {2024}
}