中文

HSD:面向文档解析视觉语言模型的训练-free 加速方案,基于分层推测解码

计算机视觉与模式识别 2026-03-31 v2

摘要

文档解析是多模态理解的基础任务,支持信息抽取和智能文档分析等众多下游应用。凭借强大的语义建模和鲁棒的泛化能力,基于视觉语言模型的端到端方法近年来成为主流范式。然而,这些模型常因需处理长文档而产生长序列,导致推断延迟显著。虽然近期的混合方法通过区域级并行解码来缓解此问题,但独立的区域解码会丢失全页上下文,可能削弱全局一致性。为此,我们提出分层推测解码 (Hierarchical Speculative Decoding, HSD),一种面向文档解析的两阶段从局部到全局的框架。HSD 首先采用轻量级管道草稿器预测区域划分并为每个区域生成粗略草稿。第一阶段对生成的区域级草稿进行并行验证以提高效率,而第二阶段进一步对这些优化后的输出进行全页级验证,以保持全页一致性。实验结果表明,我们的 HSD 在 OmniDocBench v1.5 上的 HunyuanOCR 实现 2.78 倍接近无损的加速比,并在长文档解析任务中实现最高 7.04 倍加速,充分展示了所提出方法的有效性。我们将发布代码以促进可重复性。

关键词

引用

@article{arxiv.2602.12957,
  title  = {HSD: Training-Free Acceleration for Document Parsing Vision-Language Model with Hierarchical Speculative Decoding},
  author = {Wenhui Liao and Hongliang Li and Pengyu Xie and Xinyu Cai and Yufan Shen and Yi Xin and Qi Qin and Shenglong Ye and Tianbin Li and Ming Hu and Junjun He and Yihao Liu and Wenhai Wang and Min Dou and Bin Fu and Botian Shi and Yu Qiao and Lianwen Jin},
  journal= {arXiv preprint arXiv:2602.12957},
  year   = {2026}
}