中文

大型语言与视觉模型的潜在幽灵

计算机视觉与模式识别 2024-09-24 v1

摘要

视觉指令调谐的成功推动了大型语言和视觉模型 (LLVMs) 的发展。遵循指令微调大型语言模型 (LLM) 的比例规律,LLVMs 要么进一步扩大规模,达到 26B、34B,甚至 80B 参数。虽然模型规模的增加显著提升了性能,但训练和推理都需要大量硬件资源。因此,迫切需要一种高效 LLVMs,以在规模更小的情况下实现更大模型的性能。为此,我们提出一种新型高效 LLVMs 家族,模型规模为 0.5B、1.8B、3.8B 和 7B 参数,名为 Phantom,通过在多头自注意力 (MHSA) 中暂时增加潜在隐藏维度,使 LLVMs 在不显著增加物理模型规模的情况下,具备准备在潜在空间中学习和理解更多视觉语言知识的能力。为最大化其优势,我们引入 Phantom 优化 (PO),使用自回归监督微调 (SFT) 和直接偏好优化 (DPO) 类似概念,有效遵循正确答案,消除错误和模糊答案。Phantom 在众多更大型的开源和闭源 LLVMs 中均表现出色,成为高效 LLVMs 版图中的领先解决方案。

关键词

引用

@article{arxiv.2409.14713,
  title  = {Phantom of Latent for Large Language and Vision Models},
  author = {Byung-Kwan Lee and Sangyun Chung and Chae Won Kim and Beomchan Park and Yong Man Ro},
  journal= {arXiv preprint arXiv:2409.14713},
  year   = {2024}
}

备注

Code is available in https://github.com/ByungKwanLee/Phantom