视觉大模型的编码器是否总是更大?
计算机视觉与模式识别
2024-08-02 v1 计算与语言
摘要
近年来,多模态大语言模型(MLLM)在实际应用中显示出巨大的潜力。它们因其卓越的多模态信息理解能力以及内在的强大认知和推理能力而快速发展。尽管如此,在当前主流范式下,视觉语言模型(VLM)的规模化趋势并未得到广泛研究。我们能通过训练更大的模型来实现更好的性能仍不明确。为此,我们针对 MLLM 的预训练阶段开展了实验。我们使用不同的编码器规模和大语言模型(LLM)规模进行实验。我们的发现表明,仅增加编码器的规模并不一定会提高 VLM 的性能。此外,我们分析了 LLM 背板参数规模和数据质量对预训练结果的影响。我们还探讨了 LLM 和 VLM 之间的规模定律差异。
引用
@article{arxiv.2408.00620,
title = {Are Bigger Encoders Always Better in Vision Large Models?},
author = {Bozhou Li and Hao Liang and Zimo Meng and Wentao Zhang},
journal= {arXiv preprint arXiv:2408.00620},
year = {2024}
}