中文

GLM-OCR 技术报告

计算与语言 2026-03-17 v2

摘要

GLM-OCR 是一个高效的0.9B参数紧凑型多模态模型,专为实际文档理解设计。它由0.4B参数的CogViT视觉编码器和0.5B参数的GLM语言解码器组成,在计算效率与识别性能之间取得了良好平衡。为解决标准自回归解码在确定性OCR任务中的低效问题,GLM-OCR引入了多标记预测(Multi-Token Prediction, MTP)机制,每个步骤预测多个标记,显著提高解码吞吐量,同时通过共享参数保持低内存开销。在系统层面,采用两阶段管道:PP-DocLayout-V3首先进行布局分析,随后进行并行区域级识别。广泛的在公共基准和工业场景评估表明,GLM-OCR 在文档解析、文本与公式转录、表格结构恢复以及关键信息提取等任务上实现了竞争甚至领先的性能。其紧凑架构和结构化生成使其既适用于资源受限的边缘部署,也适用于大规模生产系统。

关键词

引用

@article{arxiv.2603.10910,
  title  = {GLM-OCR Technical Report},
  author = {Shuaiqi Duan and Yadong Xue and Weihan Wang and Zhe Su and Huan Liu and Sheng Yang and Guobing Gan and Guo Wang and Zihan Wang and Shengdong Yan and Dexin Jin and Yuxuan Zhang and Guohong Wen and Yanfeng Wang and Yutao Zhang and Xiaohan Zhang and Wenyi Hong and Yukuo Cen and Da Yin and Bin Chen and Wenmeng Yu and Xiaotao Gu and Jie Tang},
  journal= {arXiv preprint arXiv:2603.10910},
  year   = {2026}
}