中文

引入视觉专家以解决多模态大语言模型中的信息损失

计算机视觉与模式识别 2024-01-17 v2 多媒体

摘要

多模态大语言模型(MLLMs)正经历快速发展,近几个月涌现出大量值得关注的贡献。当前主流趋势是采用数据驱动方法,收集多样化的指令遵循数据集。然而,这些方法仍面临一个普遍挑战,即视觉感知能力有限,因为通常使用类似 CLIP 的编码器从输入中提取视觉信息。尽管这些编码器在数十亿图像-文本对上进行了预训练,但由于文本描述仅能部分捕捉图像内容,它们仍受困于信息损失困境。为解决这一局限,本文提出通过混合专家知识增强机制来提升 MLLMs 的视觉感知能力。具体而言,我们引入一种新方法,将多任务编码器和视觉工具集成到现有 MLLMs 的训练与推理流程中,旨在提供更全面、更准确的视觉输入概括。大量实验评估了该方法在提升 MLLMs 方面的有效性,展示了通过整合视觉专家所实现的视觉感知改进。

关键词

引用

@article{arxiv.2401.03105,
  title  = {Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models},
  author = {Xin He and Longhui Wei and Lingxi Xie and Qi Tian},
  journal= {arXiv preprint arXiv:2401.03105},
  year   = {2024}
}