中文

TextHawk2: 以16倍更少Token在双语OCR与定位任务中表现出色的大型视觉语言模型

计算机视觉与模式识别 2024-10-08 v1 人工智能

摘要

读取密集文本和在图像中定位目标是大型视觉语言模型执行高级任务的基本能力。先前的LVLM,包括像GPT-4o这样的优越专有模型,难以在这两项任务上同时表现出色。此外,先前具有细粒度感知能力的LVLM每张图像需要数千个token,资源消耗巨大。我们提出TextHawk2,一个具有高效细粒度感知能力的双语LVLM,在通用、OCR和定位任务中展现出顶尖性能,而每张图像的token数量减少了16倍。关键改进包括:(1) Token压缩:在其前身高效架构的基础上,TextHawk2将每张图像的token数量显著减少了16倍,从而以最少的资源促进了TextHawk系列的训练和部署。(2) 视觉编码器增强:我们通过LVLM协同训练增强了视觉编码器,释放了其在先前未见任务(如中文OCR和定位)上的潜力。(3) 数据多样性:我们在保持1亿样本可比规模的同时,使预训练数据的来源多样化。我们在多个基准上评估了TextHawk2,它持续提供卓越的性能,并优于类似规模的开源模型,例如在OCRBench上达到78.4%的准确率,在ChartQA上达到81.4%的准确率,在DocVQA上达到89.6%的ANLS,在RefCOCOg-test上达到88.1%的[email protected]

关键词

引用

@article{arxiv.2410.05261,
  title  = {TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens},
  author = {Ya-Qi Yu and Minghui Liao and Jiwen Zhang and Jihao Wu},
  journal= {arXiv preprint arXiv:2410.05261},
  year   = {2024}
}