中文

Youtu-Parsing:通过高并行度解码实现感知、结构化与识别

计算机视觉与模式识别 2026-01-29 v1

摘要

本文提出 Youtu-Parsing,一种高效且多功能的文档解析模型,专为高性能内容提取设计。该架构采用原生 Vision Transformer (ViT),配备动态分辨率视觉编码器以提取共享文档特征,并结合提示引导的 Youtu-LLM-2B 语言模型进行布局分析和区域提示解码。利用这种解耦且特征可复用的框架,我们引入了一种高并行度解码策略,包含两个核心组件:令牌并行和查询并行。令牌并行策略在每个推理步骤中并发生成多达 64 个候选令牌,随后通过验证机制进行验证。这种方法比传统的自回归解码实现了 5-11 倍的加速,特别适用于高度结构化的场景,例如表格识别。为进一步利用区域提示解码的优势,查询并行策略能够同时预测多个边界框(最多五个)的内容,在保持与标准解码相当的输出质量的同时,提供了额外的 2 倍加速。Youtu-Parsing 涵盖了多样化的文档元素,包括文本、公式、表格、图表、印章和层次结构。此外,该模型在处理稀有字符、多语言文本和手写内容时表现出强大的鲁棒性。大量评估表明,Youtu-Parsing 在 OmniDocBench 和 olmOCR-bench 两个基准测试上均达到了最先进的性能。总体而言,Youtu-Parsing 对于大规模文档智能应用展示了显著的实验价值和实用效用。

关键词

引用

@article{arxiv.2601.20430,
  title  = {Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding},
  author = {Kun Yin and Yunfei Wu and Bing Liu and Zhongpeng Cai and Xiaotian Li and Huang Chen and Xin Li and Haoyu Cao and Yinsong Liu and Deqiang Jiang and Xing Sun and Yunsheng Wu and Qianyu Li and Antai Guo and Yanzhen Liao and Yanqiu Qu and Haodong Lin and Chengxu He and Shuangyin Liu},
  journal= {arXiv preprint arXiv:2601.20430},
  year   = {2026}
}