面向文档理解的 Token 级文本图像基础模型
计算机视觉与模式识别
2025-03-18 v2
摘要
近年来,通用视觉基础模型(VFMs)得到了越来越多的应用,特别是作为流行的多模态大语言模型(MLLMs)的图像编码器。然而,由于缺乏语义细粒度的监督,这些模型在下游文本图像相关任务的场景中,即对包含小而密集文本的图像进行感知、理解和推理时,仍然会遇到基本的预测错误。为了弥补这一差距,我们开发了 TokenOCR,这是首个专为文本图像相关任务量身定制的 Token 级视觉基础模型,旨在支持各种传统的下游应用。为了促进 TokenOCR 的预训练,我们还设计了一条高质量数据生产流水线,构建了首个 Token 级图像文本数据集 TokenIT,包含 2000 万张图像和 18 亿个 Token-掩码对。此外,利用这一具有卓越图像即文本能力的基础,我们用 TokenOCR 无缝替换了先前的 VFMs,构建了用于基于 VQA 的文档理解任务的文档级 MLLM TokenVL。最后,大量实验证明了 TokenOCR 和 TokenVL 的有效性。代码、数据集和权重将在 https://github.com/Token-family/TokenFD 上提供。
引用
@article{arxiv.2503.02304,
title = {A Token-level Text Image Foundation Model for Document Understanding},
author = {Tongkun Guan and Zining Wang and Pei Fu and Zhengtao Guo and Wei Shen and Kai Zhou and Tiezhu Yue and Chen Duan and Hao Sun and Qianyi Jiang and Junfeng Luo and Xiaokang Yang},
journal= {arXiv preprint arXiv:2503.02304},
year = {2025}
}
备注
23 pages