中文

StrucTexTv3:一种用于富文本图像感知、理解及更多任务的高效视觉语言模型

计算机视觉与模式识别 2024-06-05 v3

摘要

富文本图像具有重要且广泛的价值,深度融入人类生活的各个方面。值得注意的是,富文本图像中的视觉线索和语言符号在信息传递中都起着至关重要的作用,但也伴随着各种挑战。因此,高效且有效地理解富文本图像是检验视觉语言模型能力的关键试金石。我们精心打造了一个高效的视觉语言模型 StrucTexTv3,专门用于处理富文本图像的各种智能任务。StrucTexTv3 的重要设计体现在以下几个方面:首先,我们采用有效的多尺度缩减视觉变换器与多粒度令牌采样器(MG-Sampler)的组合作为视觉令牌生成器,成功解决了富文本图像的高分辨率输入和复杂表示学习的挑战。其次,我们通过指令学习增强了 StrucTexTv3 的感知和理解能力,将各种面向文本的任务无缝集成到一个统一的框架中。第三,我们整理了一个全面的高质量富文本图像集合,简称为 TIM-30M,涵盖了偶然场景、办公文档、网页和截图等多种场景,从而提高了我们模型的鲁棒性。我们的方法在富文本图像感知任务中取得了 SOTA 结果,并在理解任务中显著提升了性能。在具有约 1.8B 参数的 LLM 解码器的多模态模型中,它脱颖而出成为领导者,这也使得在边缘设备上的部署成为可能。总之,StrucTexTv3 模型以其高效的结构设计、出色的性能和广泛的适应性,为涉及富文本图像的各种智能应用任务提供了有力支持,展现出巨大的广泛应用潜力。

关键词

引用

@article{arxiv.2405.21013,
  title  = {StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond},
  author = {Pengyuan Lyu and Yulin Li and Hao Zhou and Weihong Ma and Xingyu Wan and Qunyi Xie and Liang Wu and Chengquan Zhang and Kun Yao and Errui Ding and Jingdong Wang},
  journal= {arXiv preprint arXiv:2405.21013},
  year   = {2024}
}