FastOCR:基于 KV 缓存剪枝的动态视觉注视文档解析
计算机视觉与模式识别
2026-05-19 v1 计算与语言
摘要
视觉语言模型(VLM)在光学字符识别(OCR)方面显示出强大的潜力,但编码稠密文档所需的视觉标记数量大,导致推理成本高昂。现有剪枝方法依赖物理驱逐,例如在 prefill 阶段永久性地丢弃视觉标记。虽然对自然图像有效,但该策略在 OCR 中基本失效,因为几乎每个视觉标记都可能对应字符或结构元素,任何不可逆的丢失都会导致严重的准确率下降。我们观察到,尽管文档图像在全局上稠密且看起来难以剪枝,但模型对它们的注意力实际上在时序上是稀疏的:在每个解码步骤中,它只关注一个小区域,这个区域在步骤之间逐渐移动,就像人类读者依次聚焦于连续单词,而不是一次性感知整个页面。基于此动态视觉注视现象,我们将原本难以解决的全局剪枝问题重新表述为可处理的局部动态问题,提出 FastOCR 框架,该框架包含两个互补模块。具体而言,Focal-Guided Pruning 在每个步骤中识别出一小组关键层并从中选择最具任务相关性的视觉标记,而 Cross-Step Fixation Reuse 利用注视的逐渐移动,利用前一步的注意力为后续步骤进行 warm-start。通过动态调整哪些标记被关注,而不是从缓存中驱逐任何标记,FastOCR 避免了信息的永久性丢失。大量实验表明,FastOCR 作为一个即插即用加速模块,能在五种不同规模和架构的 VLM 上一致地实现良好效果。在 Qwen2.5-VL 上,FastOCR 保留了未剪枝模型 98% 的准确率,同时每个解码步骤只关注 5% 的视觉标记,将注意力延迟降低 3.0 倍。
引用
@article{arxiv.2605.17447,
title = {FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing},
author = {Zihan Tang and Leqi Shen and Hui Chen and Ao Wang and Ben Wan and Yan Feng and Ke Zhang and Sicheng Zhao and Tongxuan Liu and Guiguang Ding},
journal= {arXiv preprint arXiv:2605.17447},
year = {2026}
}