中文

DeepSeek-OCR:基于光学映射的上下文压缩

计算机视觉与模式识别 2025-10-22 v1

摘要

我们提出了 DeepSeek-OCR,以探讨通过光学二维映射压缩长文本上下文的可行性。DeepSeek-OCR 由两个组件构成:DeepEncoder 和 DeepSeek3B-MoE-A570M 作为解码器。具体而言,DeepEncoder 作为核心引擎,旨在在高分辨率输入下保持低激活值,同时实现高压缩比,以确保最佳且可管理的视觉 token 数量。实验表明,当文本 token 数量在视觉 token 数量的 10 倍以内时(即压缩比 < 10x),模型可实现 97% 的解码(OCR)精度。即使在压缩比为 20x 时,OCR 准确率仍约为 60%。这显示出在历史长上下文压缩和大语言模型中记忆遗忘机制方面的潜力。此外,DeepSeek-OCR 还具有很高的实际应用价值。在OmniDocBench上,它仅使用 100 个视觉 token 即可超越 GOT-OCR2.0(256 tokens/page),并在使用不足 800 个视觉 token的条件下超过 MinerU2.0(平均每页 6000+ tokens)。在实际生产中,DeepSeek-OCR 可实现每日 20 万+ 页的训练数据生成(单张 A100-40G)。代码和模型权重已公开访问于 http://github.com/deepseek-ai/DeepSeek-OCR。

关键词

引用

@article{arxiv.2510.18234,
  title  = {DeepSeek-OCR: Contexts Optical Compression},
  author = {Haoran Wei and Yaofeng Sun and Yukun Li},
  journal= {arXiv preprint arXiv:2510.18234},
  year   = {2025}
}