中文

HunyuanOCR 技术报告

计算机视觉与模式识别 2025-12-12 v2 人工智能

摘要

本文介绍了 HunyuanOCR,这是一款面向 OCR 任务的商业级、开源且轻量级(1B 参数)视觉语言模型(VLM)。其架构由原生视觉Transformer(ViT)和通过MLP适配器连接的轻量级大语言模型(LLM)构成。HunyuanOCR 在性能上表现突出,超越了商业 API、传统管线以及更大规模的模型(如 Qwen3-VL-4B)。具体而言,它在感知任务(文本检测、文本解析)中超越当前公开解决方案,在语义任务(信息提取、文本图像翻译)中表现卓越,并在 ICDAR 2025 DIM 挑战赛(小模型赛道)中夺得冠军。此外,HunyuanOCR 在参数不足 3B 的 VLMs 中实现了 OCRBench 的最新成绩。HunyuanOCR 在三个关键方面实现了突破:1)统一 versatility 与 efficiency:我们实现了对核心能力(检测、解析、信息提取、VQA、翻译)的全面支持,构建在轻量化框架内。这一举措弥补了狭义“OCR 专家模型”的局限性和高效“通用 VLM”的不足。2)简化端到端架构:采用纯粹的端到端范式,消除了依赖前处理模块(如布局分析)的问题,从根本上解决了传统管线中常见的误差传播,简化了系统部署。3)数据驱动与 RL 策略:我们确认高质量数据的关键作用,并首次在行业范围内证明,强化学习(RL)策略在 OCR 任务中可显著提升性能。HunyuanOCR 已在 HuggingFace 官方开源。我们还提供了基于 vLLM 的高性能部署方案,将其生产效率提升至行业领先水平。我们希望该模型能推动前沿研究,为工业应用提供坚实基础。

关键词

引用

@article{arxiv.2511.19575,
  title  = {HunyuanOCR Technical Report},
  author = {Hunyuan Vision Team and Pengyuan Lyu and Xingyu Wan and Gengluo Li and Shangpin Peng and Weinong Wang and Liang Wu and Huawen Shen and Yu Zhou and Canhui Tang and Qi Yang and Qiming Peng and Bin Luo and Hower Yang and Xinsong Zhang and Jinnian Zhang and Houwen Peng and Hongming Yang and Senhao Xie and Longsha Zhou and Ge Pei and Binghong Wu and Rui Yan and Kan Wu and Jieneng Yang and Bochao Wang and Kai Liu and Jianchen Zhu and Jie Jiang and Linus and Han Hu and Chengquan Zhang},
  journal= {arXiv preprint arXiv:2511.19575},
  year   = {2025}
}