中文

HRVDA:高分辨率视觉文档助手

计算机视觉与模式识别 2024-04-11 v1

摘要

利用大量训练数据,多模态大语言模型(MLLMs)展现了强大的通用视觉理解能力,并在各种任务中取得了显著性能。然而,它们在视觉文档理解方面的性能仍有很大提升空间。这种差异主要归因于视觉文档理解是一项细粒度预测任务。在自然场景中,MLLMs通常使用低分辨率图像,导致大量视觉信息丢失。此外,通用MLLMs在处理文档导向指令方面并不擅长。在本文中,我们提出了高分辨率视觉文档助手(HRVDA),它弥合了MLLMs与视觉文档理解之间的差距。该模型采用内容过滤机制和指令过滤模块,分别过滤掉与内容无关的视觉标记和与指令无关的视觉标记,从而实现对高分辨率图像的高效模型训练和推理。此外,我们构建了一个面向文档的视觉指令微调数据集,并采用多阶段训练策略来增强模型的文档建模能力。大量实验表明,我们的模型在多个文档理解数据集上达到了最先进的性能,同时保持了与低分辨率模型相当的训练效率和推理速度。

关键词

引用

@article{arxiv.2404.06918,
  title  = {HRVDA: High-Resolution Visual Document Assistant},
  author = {Chaohu Liu and Kun Yin and Haoyu Cao and Xinghua Jiang and Xin Li and Yinsong Liu and Deqiang Jiang and Xing Sun and Linli Xu},
  journal= {arXiv preprint arXiv:2404.06918},
  year   = {2024}
}

备注

Accepted to CVPR 2024 main conference