利用粗到细视觉处理提升文档解析效率与性能
计算机视觉与模式识别
2026-04-06 v2 人工智能
信息检索
摘要
文档解析是一项粒度细致的任务,图像分辨率对性能影响显著。虽然先进的研究利用视觉语言模型 (vision-language models) 通过高分辨率输入提升模型性能,但这往往导致视觉标记数量呈二次方增长,显著提高计算成本。我们认为这种效率低下源于文档图像中大量视觉冗余区域的存在,如背景。为此,我们提出 PaddleOCR-VL,一种新型粗到细架构,专注于语义相关区域,抑制冗余区域,从而提升效率与性能。具体而言,我们引入轻量级有效区域聚焦模块 (Valid Region Focus Module, VRFM),利用局部化和上下文关系预测能力识别有效视觉标记。随后,我们设计并训练了一个紧凑且强大的 0.9B 参数视觉语言模型 (PaddleOCR-VL-0.9B),依据 VRFM 输出执行细粒度识别,避免直接处理整幅大图像。大量实验表明,PaddleOCR-VL 在页面级解析和要素级识别方面均实现了最先进的性能,显著优于现有解决方案,在顶尖 VLMs 中也表现出强劲竞争力,同时实现快速推理,大幅减少视觉标记和参数数量,凸显了面向精准高效文档理解的有针对性的粗到细解析方法的有效性。该项目源码与模型已公开于 https://github.com/PaddlePaddle/PaddleOCR。
关键词
引用
@article{arxiv.2603.24326,
title = {Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing},
author = {Cheng Cui and Ting Sun and Suyin Liang and Tingquan Gao and Zelun Zhang and Jiaxuan Liu and Xueqing Wang and Changda Zhou and Hongen Liu and Manhui Lin and Yue Zhang and Yubo Zhang and Jing Zhang and Jun Zhang and Xing Wei and Yi Liu and Dianhai Yu and Yanjun Ma},
journal= {arXiv preprint arXiv:2603.24326},
year = {2026}
}
备注
Accepted by CVPR2026