中文

视觉功绩还是语言依赖?对 DeepSeek-OCR 的深度考察

计算与语言 2026-01-09 v2 计算机视觉与模式识别

摘要

DeepSeek-OCR 采用光学 2D 映射方法实现高比例视觉-文本压缩,声称解码的文本标记数是输入视觉标记数的十倍。这一技术似乎为 LLM 长上下文瓶颈提供了有前景的解决方案,但我们调查了一个关键问题:“是视觉功绩还是语言依赖——哪个驱动了 DeepSeek-OCR 的性能?”通过采用句子级和词级语义扰码,我们隔离模型的固有 OCR 能力与语言先验。结果显示,在无语言支持情况下,DeepSeek-OCR 的性能从约90%骤降至20%。与 13 个基线模型的对比表明,传统管道式 OCR 方法在面对此类语义扰码时显著优于端到端方法。进一步发现,较低的视觉标记数与更高的先验依赖性呈正相关,加剧了幻觉风险。情境压力测试也揭示,在约 10,000 文本标记处模型会总体崩溃,表明当前的光学压缩技术可能反而恶化长上下文瓶颈。本研究实证界定了 DeepSeek-OCR 的能力边界,为未来的视觉-文本压缩范式提供了关键见解。我们在 https://github.com/dududuck00/DeepSeekOCR 上发布了所有数据、结果和脚本。

关键词

引用

@article{arxiv.2601.03714,
  title  = {Visual Merit or Linguistic Crutch? A Close Look at DeepSeek-OCR},
  author = {Yunhao Liang and Ruixuan Ying and Bo Li and Hong Li and Kai Yan and Qingwen Li and Min Yang and Okamoto Satoshi and Zhe Cui and Shiwen Ni},
  journal= {arXiv preprint arXiv:2601.03714},
  year   = {2026}
}