面向OCR-free稠密文档理解的Prompt引导视觉编码器
计算机视觉与模式识别
2025-03-27 v2
摘要
近年来,视觉文档理解领域取得了显著进展,主流架构构成为视觉模型与语言模型的级联。文本组件可通过外部OCR模型显式提取(OCR-based方法),或视觉模型可赋予阅读能力(OCR-free方法)。通常,模型的查询仅输入到语言组件,要求视觉特征涵盖整个文档。本文提出VisFocus,一种OCR-free方法,旨在更好地利用视觉编码器的容量,通过直接与语言提示耦合。为此,我们替换下采样层为接收输入提示的层,允许突出显示文档的相关部分,忽略其他部分。我们配合新颖的预训练任务使用语言掩码,对文档文本片段输入视觉编码器以取代提示,赋予模型聚焦能力。因此,VisFocus学习在给定提示的文本块上分配注意力。我们的实验表明,这种提示引导的视觉编码方法显著提升了性能,在各种基准测试上实现了最先进的结果。
引用
@article{arxiv.2407.12594,
title = {VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document Understanding},
author = {Ofir Abramovich and Niv Nayman and Sharon Fogel and Inbal Lavi and Ron Litman and Shahar Tsiper and Royee Tichauer and Srikar Appalaraju and Shai Mazor and R. Manmatha},
journal= {arXiv preprint arXiv:2407.12594},
year = {2025}
}
备注
ECCV 2024, official code at https://github.com/amazon-science/visfocus