通过链视域加速多模态大语言模型的预训练
计算机视觉与模式识别
2024-07-23 v1
摘要
本文介绍了 Chain-of-Sight,一种加速多模态大语言模型(MLLM)预训练的视觉语言桥接模块。我们的方法采用一系列在不同空间尺度上捕获视觉细节的视觉重采样器。该架构不仅有效地利用全局和局部视觉上下文,还通过复合 token 扩展策略实现了对视觉 token 的灵活扩展,使其在预训练后可实现最多16倍的 token 计数增加。因此,Chain-of-Sight 在预训练阶段所需的视觉 token 数量显著低于微调阶段。这一刻意减少预训练期间视觉 token 的做法显著加快了预训练过程,将训练时间缩短约73%。在一系列视觉语言基准测试中实现了预训练加速,且性能不打折,与标准管道相当或更好,后者在整个训练过程中使用所有视觉 token。进一步增加预训练的视觉 token 数量可获得更强的性能,在一系列基准测试中与现有方法保持竞争力。
引用
@article{arxiv.2407.15819,
title = {Accelerating Pre-training of Multimodal LLMs via Chain-of-Sight},
author = {Ziyuan Huang and Kaixiang Ji and Biao Gong and Zhiwu Qing and Qinglong Zhang and Kecheng Zheng and Jian Wang and Jingdong Chen and Ming Yang},
journal= {arXiv preprint arXiv:2407.15819},
year = {2024}
}