OmniParser:面向文本定位、关键信息提取与表格识别的统一框架
计算机视觉与模式识别
2024-03-29 v1
摘要
近年来,受自动化文档理解需求不断增长以及能够处理基于文档问题的生成式大语言模型(LLM)出现的推动,视觉情境文本解析取得了显著进展。人们已经提出了多种方法来解决 VsTP 这一具有挑战性的问题。然而,由于目标的多样性和模式的异构性,以往的工作通常为单个任务设计特定的架构和目标,这无意中导致了模态孤立和复杂的工作流程。在本文中,我们提出了一种跨多种场景解析视觉情境文本的统一范式。具体而言,我们设计了一个名为 OmniParser 的通用模型,它可以同时处理三个典型的视觉情境文本解析任务:文本定位、关键信息提取和表格识别。在 OmniParser 中,所有任务共享统一的编码器-解码器架构、统一的目标:点条件文本生成,以及统一的输入与输出表示:提示词与结构化序列。大量实验表明,尽管采用了统一、简洁的设计,所提出的 OmniParser 在三个视觉情境文本解析任务的 7 个数据集上实现了 SOTA 或极具竞争力的性能。代码可在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery 获取。
引用
@article{arxiv.2403.19128,
title = {OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition},
author = {Jianqiang Wan and Sibo Song and Wenwen Yu and Yuliang Liu and Wenqing Cheng and Fei Huang and Xiang Bai and Cong Yao and Zhibo Yang},
journal= {arXiv preprint arXiv:2403.19128},
year = {2024}
}
备注
CVPR 2024