LMEye:面向大语言模型的交互式感知网络
计算机视觉与模式识别
2023-09-29 v6 人工智能
摘要
从零训练多模态大语言模型(MLLM,如 GPT-4)资源消耗巨大。我们将大语言模型(LLMs)视为多模态信息的核心处理器,本文提出 LMEye——一种具备即插即用交互式感知网络、类人眼睛的系统,旨在实现 LLMs 与外部视觉信息间的动态交互。先前方法通过简单视觉映射网络或来自 BLIP-2 的 Q-former 将视觉信息融入 LLMs。此类网络仅对图像特征做一次投影,未考虑图像与人类输入查询间的交互。因此,未与人类意图关联的所得视觉信息可能不足以让 LLMs 生成遵循意图的回复,我们称之为静态视觉信息。LMEye 通过允许 LLM 请求与各类人类指令对齐的所需视觉信息来解决该问题,我们称之为动态视觉信息交互。具体而言,LMEye 包含一个简单视觉映射网络以为 LLMs 提供图像基础感知,还包含额外模块分别负责从 LLMs 获取请求、执行基于请求的视觉信息交互,以及将交互所得视觉信息传回 LLMs。如此,LLMs 起到理解人类查询、向基于请求的视觉信息交互模块传递相应请求、并基于交错多模态信息生成回复的作用。我们在若干多模态基准上通过大量实验评估 LMEye,表明相较于先前方法,它以更少参数量显著提升了在各多模态任务上的零样本性能。
引用
@article{arxiv.2305.03701,
title = {LMEye: An Interactive Perception Network for Large Language Models},
author = {Yunxin Li and Baotian Hu and Xinyu Chen and Lin Ma and Yong Xu and Min Zhang},
journal= {arXiv preprint arXiv:2305.03701},
year = {2023}
}
备注
working in progress