中文

TroL:面向大型语言和视觉模型的层级遍历

机器学习 2024-09-26 v3 计算与语言 计算机视觉与模式识别

摘要

大型语言和视觉模型 (LLVMs) 由大型语言模型 (LLMs) 的泛化能力和视觉指令调优的不断提升驱动得益。随着直接扩大规模,这些模型使 LLVMs 能够通过自然语言指令涵盖多样任务,展现出强大的视觉语言 (VL) 性能。然而,现有的开源 LLVMs 如规模为 26B、34B 和 110B 参数的模型被认为过大,层数更多。这些大型模型需要昂贵的高端资源进行训练和推理。为此,我们提出一种新的高效 LLVM 系列,包含 1.8B、3.8B 和 7B 参数规模,Traversal of Layers (TroL),通过以 token 为单位的方式复用层级,实现层级遍历。这一层级遍历技术在不物理增加更多层的情况下,通过增加前向传播层数,模拟回顾和重述解答流程的效果。我们展示,TroL 采用简单而高效的层级遍历方法,显著优于规模更大的开源 LLVMs,甚至与规模巨大的闭源 LLVMs 相当。

关键词

引用

@article{arxiv.2406.12246,
  title  = {TroL: Traversal of Layers for Large Language and Vision Models},
  author = {Byung-Kwan Lee and Sangyun Chung and Chae Won Kim and Beomchan Park and Yong Man Ro},
  journal= {arXiv preprint arXiv:2406.12246},
  year   = {2024}
}

备注

EMNLP 2024. Code is available in https://github.com/ByungKwanLee/TroL