LaMI:通过晚期多图像融合增强大语言模型
计算与语言
2026-04-14 v2 计算机视觉与模式识别
机器学习
摘要
常识推理通常需要文本和视觉知识的结合,但仅基于文本训练的大语言模型 (LLM) 缺乏视觉 grounding(例如,"埃尔金帝企鹅的腹部是什么颜色?")。视觉语言模型 (VLM) 在视觉 grounding 任务上表现更好,但面临两个局限性:(i) 在仅基于文本的常识推理任务中性能常低于文本训练的 LLM;(ii) 将新发布的 LLM 适配视觉输入通常需要高成本的多模态训练。一种替代方法通过测试时视觉信号增强 LLM,在不损害文本推理性能的前提下提高视觉常识推理能力,但先前的设计常依赖早期融合和单张图像,这可能并非最优。我们提出一种晚期多图像融合方法:从文本提示生成多个图像(采用轻量级并行采样),其预测概率通过一种在最终预测前整合投影视觉特征的晚期融合层与仅文本的 LLM 结合。在视觉常识推理和 NLP 基准测试中,我们的方法在视觉推理方面显著优于增强型 LLM,在基于视觉的任务上与 VLM 相当,并在应用于强大的 LLM(如 LLaMA 3)时也提升了 NLP 性能,仅增加 modest 的测试时开销。项目页面地址:https://guyyariv.github.io/LaMI。
引用
@article{arxiv.2406.13621,
title = {LaMI: Augmenting Large Language Models via Late Multi-Image Fusion},
author = {Guy Yariv and Idan Schwartz and Yossi Adi and Sagie Benaim},
journal= {arXiv preprint arXiv:2406.13621},
year = {2026}
}
备注
Accepted to ACL 2026