MouSi:多视觉专家视觉-语言模型
计算机视觉与模式识别
2024-01-31 v1 人工智能
计算与语言
机器学习
摘要
当前的大型视觉-语言模型 (VLM) 经常遇到诸如单个视觉组件能力不足和视觉令牌过长等挑战。这些问题可能限制模型准确解释复杂视觉信息以及处理过长上下文信息的有效性。应对这些挑战对于提升 VLM 的性能和适用性至关重要。本文提出使用集成专家技术来协同各个视觉编码器的能力,包括那些擅长图像-文本匹配、OCR、图像分割等的编码器。该技术引入一个融合网络来统一处理来自不同视觉专家的输出,同时弥合图像编码器与预训练大语言模型 (LLM) 之间的差距。此外,我们探索了不同的位置编码方案,以缓解由冗长的图像特征序列引起的位置编码浪费,有效解决了位置溢出和长度限制问题。例如,在我们的实现中,该技术显著降低了像 SAM 这类模型中的位置占用,从庞大的 4096 降至更高效且易于管理的 64,甚至低至 1。实验结果表明,拥有多个专家的 VLM 表现出比孤立的视觉编码器持续更优的性能,并且随着更多专家的集成,性能显著提升。我们已开源本报告中使用的训练代码。所有这些资源都可以在我们的项目网站上找到。
引用
@article{arxiv.2401.17221,
title = {MouSi: Poly-Visual-Expert Vision-Language Models},
author = {Xiaoran Fan and Tao Ji and Changhao Jiang and Shuo Li and Senjie Jin and Sirui Song and Junke Wang and Boyang Hong and Lu Chen and Guodong Zheng and Ming Zhang and Caishuang Huang and Rui Zheng and Zhiheng Xi and Yuhao Zhou and Shihan Dou and Junjie Ye and Hang Yan and Tao Gui and Qi Zhang and Xipeng Qiu and Xuanjing Huang and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2401.17221},
year = {2024}
}