基于原理蒸馏的高效端到端视觉文档理解
计算机视觉与模式识别
2024-04-03 v2 计算与语言
摘要
理解视觉情境化语言需要解释文本与视觉元素的复杂版式。光学字符识别(OCR)等预处理工具可将文档图像输入映射为文本令牌,随后大语言模型(LLM)可对文本进行推理。然而,此类方法具有较高计算与工程复杂度。小型预训练图像到文本模型能否通过类似的识别与推理步骤准确理解视觉文档?我们提出原理蒸馏(RD),其将OCR工具、LLM及更大多模态模型的输出作为中间“原理”,并训练小型学生模型同时预测原理与答案。在代表信息图、扫描文档和插图的三个视觉文档理解基准上,我们经RD微调的Pix2Struct(2.82亿参数)学生模型以仅高1%的计算成本,比基础模型绝对精度高出4–5%。
引用
@article{arxiv.2311.09612,
title = {Efficient End-to-End Visual Document Understanding with Rationale Distillation},
author = {Wang Zhu and Alekh Agarwal and Mandar Joshi and Robin Jia and Jesse Thomason and Kristina Toutanova},
journal= {arXiv preprint arXiv:2311.09612},
year = {2024}
}
备注
Accepted by NAACL 2024