中文

解释、剪枝与蒸馏Donut:面向文档VQA的轻量级VLM

计算机视觉与模式识别 2025-10-01 v1

摘要

视觉丰富文档理解的最新进展依赖于像Donut这样的大型视觉-语言模型(VLM),它们无需光学字符识别即可执行文档级视觉问答(VQA)。尽管这些模型效果显著,但对于实时或资源受限的应用而言,其成本过高。我们研究了通过知识蒸馏进行模型压缩,从较大的教师模型训练紧凑的学生模型。在此框架内,我们利用机制可解释性来驱动学生架构设计。通过分析内部计算,我们识别出需要保留的基本子组件,同时根据其功能明确哪些子组件应被近似、跳过或重新参数化。这种方法产生了Donut-MINT(基于机制可解释性的网络修剪),这是一种剪枝后的Donut变体,在减少推理时间和内存占用的同时,在文档VQA的标准基准DocVQA上保持了强大的性能。我们的方法将压缩重新定义为电路发现,连接了可解释性研究和实际的视觉-语言模型部署。

关键词

引用

@article{arxiv.2509.26235,
  title  = {Interpret, prune and distill Donut : towards lightweight VLMs for VQA on document},
  author = {Adnan Ben Mansour and Ayoub Karine and David Naccache},
  journal= {arXiv preprint arXiv:2509.26235},
  year   = {2025}
}

备注

Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China