中文

BcQLM:通过浓缩 Q 门控跨模态融合实现高效视觉语言理解

计算机视觉与模式识别 2025-09-11 v1

摘要

随着多模态大语言模型(MLLM)的不断发展,其大规模架构为资源受限环境的部署带来了挑战。在大模型时代,能源效率、计算可扩展性和环境可持续性至关重要,开发轻量级高性能模型对实际应用至关重要。为此,我们提出一种轻量级 MLLM 框架,用于端到端视觉问答。我们的主要方法以 BreezeCLIP 为核心,即为高效多模态理解优化的紧凑强大的视觉语言编码器。该模型整体仅需 12 亿参数,显著降低了计算成本,同时在性能上与标准规模的 MLLM 相当。在多个数据集上的实验进一步验证了其在 accuracy 与 efficiency 之间取得有效平衡的效果。该模块化可扩展设计使其能够泛化到更广泛的多模态任务。所提出的轻量级视觉语言框架称为 BcQLM(BreezeCLIP 增强型 Q 门控多模态语言模型)。它为在实际硬件约束条件下可部署的 MLLM 提供了可行路径。源代码已公开于 https://github.com/thico0224/BcQLM。

关键词

引用

@article{arxiv.2509.08715,
  title  = {BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion},
  author = {Sike Xiang and Shuang Chen and Amir Atapour-Abarghouei},
  journal= {arXiv preprint arXiv:2509.08715},
  year   = {2025}
}