LayoutLLM:基于大语言模型布局指令微调的文档理解
计算机视觉与模式识别
2024-04-09 v1 计算与语言
摘要
近期,利用大语言模型(LLMs)或多模态大语言模型(MLLMs)进行文档理解已被证明极具前景。然而,以往采用 LLMs/MLLMs 进行文档理解的工作并未充分探索和利用文档布局信息,而这对精确的文档理解至关重要。在本文中,我们提出了 LayoutLLM,一种基于 LLM/MLLM 的文档理解方法。LayoutLLM 的核心是布局指令微调策略,专门设计用于增强对文档布局的理解和利用。所提出的布局指令微调策略由两部分组成:布局感知预训练和布局感知监督微调。为了在布局感知预训练中捕捉文档布局的特征,引入了对应于文档级、区域级和片段级信息的三组预训练任务。此外,设计了一个名为布局思维链(LayoutCoT)的新模块,使 LayoutLLM 能够专注于与问题相关的区域并生成准确答案。LayoutCoT 能有效提升文档理解的性能。同时,它带来了一定程度的可解释性,有助于人工检查和纠正。在标准基准上的实验表明,所提出的 LayoutLLM 显著优于采用开源 7B LLMs/MLLMs 进行文档理解的现有方法。LayoutLLM 的训练数据已在 https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/DocumentUnderstanding/LayoutLLM 公开
引用
@article{arxiv.2404.05225,
title = {LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding},
author = {Chuwei Luo and Yufan Shen and Zhaoqing Zhu and Qi Zheng and Zhi Yu and Cong Yao},
journal= {arXiv preprint arXiv:2404.05225},
year = {2024}
}
备注
CVPR 2024