中文

Lever LM: 配置上下文序列以撬动大型视觉语言模型

计算机视觉与模式识别 2024-11-01 v4 计算与语言 机器学习

摘要

正如阿基米德的名言:“给我一个足够长的杠杆和一个支点,我就能撬动地球”,在本研究中,我们提出使用一个微型语言模型(LM),例如一个6700万参数的Transformer,来撬动更大的视觉语言模型(LVLMs),参数为90亿。具体来说,我们使用这个微小的Lever-LM来配置有效的上下文演示(ICD)序列,以提高LVLMs的上下文学习(ICL)性能。先前的研究表明,不同的ICD配置(如演示的选择和排序)严重影响ICL性能,突出了配置有效ICD序列的重要性。受此启发,并重新考虑配置ICD序列的过程,我们发现这是人类句子构成的镜像过程,并进一步假设有效的ICD配置可能包含可以被Lever-LM捕获的内部统计模式。然后构建一个包含有效ICD序列的数据集来训练Lever-LM。训练后,给定新的查询,由训练好的Lever-LM配置新的ICD序列,通过ICL解决视觉语言任务。实验表明,与一些强基线相比,这些ICD序列可以提高两个LVLMs在视觉问答和图像描述任务上的ICL性能,验证了Lever-LM确实能够捕获用于撬动LVLMs的统计模式。代码可在https://github.com/ForJadeForest/Lever-LM获取。

关键词

引用

@article{arxiv.2312.10104,
  title  = {Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models},
  author = {Xu Yang and Yingzhe Peng and Haoxuan Ma and Shuo Xu and Chi Zhang and Yucheng Han and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2312.10104},
  year   = {2024}
}

备注

17 pages, 6 figures