中文

小语言模型遇上增强视觉词汇

计算机视觉与模式识别 2024-01-24 v1

摘要

在2023年,大型视觉语言模型(LVLM)在人工智能社区中颇为流行。然而,流行的LVLM相对较大的参数量(超过70亿)使其难以在消费级GPU上训练和部署,这让许多资源有限的研究人员望而却步。想象一下,如果能在一块老旧的GTX1080ti(我们唯一的游戏卡)上体验当前LVLM的所有功能,那该有多酷。因此,我们在本报告中提出了Vary-toy,这是一个小尺寸的Vary,并以Qwen-1.8B作为基础“大”语言模型。在Vary-toy中,我们引入了一个改进的视觉词汇表,使模型不仅拥有Vary的所有功能,还获得了更强的通用性。具体来说,我们在生成视觉词汇表的过程中,用目标检测驱动的正样本数据替换了自然图像的负样本,更充分地利用了词汇网络的能力,使其能够高效地编码对应自然物体的视觉信息。实验方面,Vary-toy在DocVQA上可以达到65.6%的ANLS,在ChartQA上达到59.1%的准确率,在RefCOCO上达到88.1%的准确率,在MMVet上达到29%。代码将在项目主页上公开。

关键词

引用

@article{arxiv.2401.12503,
  title  = {Small Language Model Meets with Reinforced Vision Vocabulary},
  author = {Haoran Wei and Lingyu Kong and Jinyue Chen and Liang Zhao and Zheng Ge and En Yu and Jianjian Sun and Chunrui Han and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2401.12503},
  year   = {2024}
}