中文

OmniParser V2:面向统一视觉文本解析的结构化思考点及其对多模态大语言模型的通用性

计算机视觉与模式识别 2026-04-22 v2 计算与语言

摘要

视觉文本解析(VsTP)近期取得显著进展,得益于自动化文档理解需求的增长以及能够处理文档问题的大语言模型的出现。尽管已提出多种方法以解决VsTP的复杂问题,但现有解决方案往往依赖于针对单个任务的特定架构和目标,导致模式隔离和复杂的工作流程 due to 目标的多样化和异构的模式。本文引入OmniParser V2,一个统一模型,将VsTP典型任务(包括文本检测、关键信息提取、表格识别和布局分析)整合到统一框架中。我们方法的核心是提出的结构化思考点(Structured-Points-of-Thought, SPOT)提示模式,通过统一的编码器-解码器架构、目标和输入输出表示,提升模型在各种场景下的性能。SPOT消除了对任务特定架构和损失函数的需求,显著简化了处理流程。我们在八个数据集上的四个任务广泛评估表明,OmniParser V2在VsTP中实现了最先进或具有竞争力的结果。此外,我们探索了将SPOT集成到多模态大语言模型结构中,以进一步提升视觉文本解析能力,进而确认了SPOT提示技术的通用性。代码可在\href{https://github.com/AlibabaResearch/AdvancedLiterateMachinery}{AdvancedLiterateMachinery}获取。

关键词

引用

@article{arxiv.2502.16161,
  title  = {OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models},
  author = {Wenwen Yu and Zhibo Yang and Jianqiang Wan and Sibo Song and Jun Tang and Wenqing Cheng and Yuliang Liu and Xiang Bai},
  journal= {arXiv preprint arXiv:2502.16161},
  year   = {2026}
}

备注

Accepted by IEEE TPAMI