中文

DocKD:从大语言模型知识蒸馏用于开放文档理解模型

计算机视觉与模式识别 2024-10-07 v1 计算与语言

摘要

视觉文档理解(VDU)是一项具有挑战性的任务,涉及跨越多种模态(文本和图像)和布局(形式、表格等)的文档理解。本研究旨在通过从大语言模型(LLM)蒸馏知识来增强小型 VDU 模型的通用性。我们识别到,直接提示 LLM 往往难以生成信息丰富且有用的数据。为此,我们提出了一种新框架(称为 DocKD),通过整合外部文档知识来丰富数据生成过程。具体而言,我们提供 LLM 各种文档元素(如键值对、布局和描述),以引导其生成开放式答案。我们的实验表明,DocKD 产生高质量的文档注释,优于不利用外部文档知识的直接知识蒸馈方法。此外,仅使用 DocKD 生成的数据训练的学生 VDU 模型不仅在同一领域任务上与使用人工标注数据相当,而且在跨领域任务上显著超越人工标注数据。

关键词

引用

@article{arxiv.2410.03061,
  title  = {DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models},
  author = {Sungnyun Kim and Haofu Liao and Srikar Appalaraju and Peng Tang and Zhuowen Tu and Ravi Kumar Satzoda and R. Manmatha and Vijay Mahadevan and Stefano Soatto},
  journal= {arXiv preprint arXiv:2410.03061},
  year   = {2024}
}

备注

Accepted to EMNLP 2024