DocEdit-v2:基于多模态大语言模型的文档结构编辑
计算与语言
2024-10-23 v1
摘要
文档结构编辑涉及根据用户请求对文档图像中局部的文本、视觉和布局组件进行操作。过去的研究表明,用户请求在文档图像中的多模态定位以及准确定位准确的结构组件及其关联属性是该任务的关键挑战。为此,我们引入 DocEdit-v2,一个新型框架,利用大型多模态模型 (LMM) 实现端到端文档编辑。它包含三个新组件:(1) Doc2Command,同时定位感兴趣区域 (RoI) 并将用户编辑请求消歧化为编辑指令;(2) 基于 LLM 的指令重构提示,用于将原本针对专用软件的编辑指令转化为适用于通用 LMM 的编辑指令。(3) 此外,DocEdit-v2 通过大型多模态模型如 GPT-4V 和 Gemini 处理这些输出,解析文档布局,对基于感兴趣区域 (RoI) 的内容执行编辑,并生成编辑后的文档图像。在 DocEdit 数据集上的大量实验表明,DocEdit-v2 在编辑指令生成(提升 2-33%)、感兴趣区域边界框检测(提升 12-31%)以及整体文档编辑(提升 1-12%)等任务上显著优于强大基线。
引用
@article{arxiv.2410.16472,
title = {DocEdit-v2: Document Structure Editing Via Multimodal LLM Grounding},
author = {Manan Suri and Puneet Mathur and Franck Dernoncourt and Rajiv Jain and Vlad I Morariu and Ramit Sawhney and Preslav Nakov and Dinesh Manocha},
journal= {arXiv preprint arXiv:2410.16472},
year = {2024}
}
备注
EMNLP 2024 (Main)