DONUT-hole:基于知识利用与学习效率优化的 DONUT 稀疏化
计算机视觉与模式识别
2023-11-13 v1 人工智能
摘要
本文介绍 DONUT-hole,一种稀疏的无 OCR 视觉文档理解(VDU)模型,旨在解决其前身模型 DONUT 的局限性。DONUT 模型利用 transformer 架构,克服了独立的光学字符识别(OCR)与视觉语义理解(VSU)组件的挑战。然而,其在生产环境与边缘设备上的部署受限于高内存与计算需求,尤其在大规模请求服务中。为克服这些挑战,我们提出基于知识蒸馏与模型剪枝的优化策略。我们生成 DONUT-hole 的范式将模型密度降低 54%,同时保持性能。我们还基于中心化核对齐(CKA)度量取得了 DONUT 与 DONUT-hole 之间 0.79 的全局表征相似度指数。此外,我们在文档图像关键信息提取(KIE)任务上评估了 DONUT-hole 的有效性,凸显其在为物流公司开发更高效 VDU 系统方面的潜力。
引用
@article{arxiv.2311.05778,
title = {DONUT-hole: DONUT Sparsification by Harnessing Knowledge and Optimizing Learning Efficiency},
author = {Azhar Shaikh and Michael Cochez and Denis Diachkov and Michiel de Rijcke and Sahar Yousefi},
journal= {arXiv preprint arXiv:2311.05778},
year = {2023}
}