中文

Vary:为大型视觉语言模型扩展视觉词汇表

计算机视觉与模式识别 2023-12-12 v1

摘要

现代大型视觉语言模型 (LVLMs) 共享相同的视觉词汇表——CLIP,它可以覆盖大多数常见的视觉任务。然而,对于某些需要密集和细粒度视觉感知的特殊视觉任务,例如文档级 OCR 或图表理解,尤其是在非英语场景中,CLIP 风格的词汇表在标记视觉知识时可能效率低下,甚至遭遇词汇表外问题。为此,我们提出了 Vary,一种高效且有效的方法来扩展 LVLMs 的视觉词汇表。Vary 的过程自然地分为两个方面:新视觉词汇表的生成和集成。在第一阶段,我们设计了一个词汇表网络以及一个微小的仅解码器 Transformer,通过自回归生成所需的词汇表。接下来,我们通过将新词汇表与原始词汇表 (CLIP) 合并来扩展普通视觉词汇表,使 LVLMs 能够快速获取新特征。与流行的 BLIP-2、MiniGPT4 和 LLaVA 相比,Vary 在保持其原有能力的同时,拥有更出色的细粒度感知和理解能力。具体而言,Vary 能够胜任新的文档解析功能(OCR 或 Markdown 转换),同时在 DocVQA 上达到 78.2% 的 ANLS,在 MMVet 上达到 36.2%。我们的代码将在项目主页上公开发布。

关键词

引用

@article{arxiv.2312.06109,
  title  = {Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models},
  author = {Haoran Wei and Lingyu Kong and Jinyue Chen and Liang Zhao and Zheng Ge and Jinrong Yang and Jianjian Sun and Chunrui Han and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2312.06109},
  year   = {2023}
}