中文

多模态自适应推理用于文档图像分类的随时早期退出

计算机视觉与模式识别 2024-05-22 v1 计算与语言 机器学习

摘要

这项工作解决了在可扩展生产环境中对视觉丰富文档理解(VDU)任务在性能和效率之间取得平衡的需求。目前,人们依赖大型文档基础模型,这些模型提供先进能力但计算负担沉重。在本文中,我们提出了一种多模态早期退出(EE)模型设计,结合了各种训练策略、退出层类型和位置。我们的目标是在多模态文档图像分类的预测性能和效率之间实现帕累托最优平衡。通过一系列全面的实验,我们将我们的方法与传统的退出策略进行比较,并展示了改进的性能-效率权衡。我们的多模态EE设计保留了模型的预测能力,同时提高了速度和延迟。通过减少超过20%的延迟,同时完全保持基线准确率。这项研究是VDU社区中多模态EE设计的首次探索,也强调了校准在改善不同层退出置信度分数方面的有效性。总的来说,我们的发现通过提高性能和效率为实际的VDU应用做出了贡献。

关键词

引用

@article{arxiv.2405.12705,
  title  = {Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting},
  author = {Omar Hamed and Souhail Bakkali and Marie-Francine Moens and Matthew Blaschko and Jordy Van Landeghem},
  journal= {arXiv preprint arXiv:2405.12705},
  year   = {2024}
}

备注

Accepted at ICDAR 2024