浏览与聚焦:通过 prior-LLM 上下文融合理解多模态内容
计算与语言
2026-01-13 v3
摘要
随着大型语言模型(LLM)的蓬勃发展,集成 LLM 与预训练视觉模型的多模态大型语言模型(MLLM)近期在多样化的视觉语言任务中展现出惊人的性能。然而,它们在理解涉及多图像的上下文时仍显不足。这种不足的主要原因在于,每个图像的视觉特征由冻结的编码器单独编码后输入到 LLM 主干网络,缺乏对其他图像以及多模态指令的感知,被称为 prior-LLM 模态隔离。我们提出了两种范式——浏览与聚焦——以在输入特征进入 LLM 之前实现深入的多模态上下文融合。该范式最初“浏览”输入以获取关键见解,然后受这些见解指引“聚焦”回输入以聚焦于关键细节,从而实现对多模态输入的更全面理解。此外,我们开发了特定于多图像输入理解的训练策略。我们的方法在 7 种多图像场景中显著提升了性能,分别相对于 3B 和 11B LLM 的强大 MLLM 基线,平均准确率提升 2.13% 和 7.60%。
引用
@article{arxiv.2402.12195,
title = {Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion},
author = {Ziyue Wang and Chi Chen and Yiqi Zhu and Fuwen Luo and Peng Li and Ming Yan and Ji Zhang and Fei Huang and Maosong Sun and Yang Liu},
journal= {arXiv preprint arXiv:2402.12195},
year = {2026}
}
备注
17 pages, 5 figures