中文

MM-REACT:提示ChatGPT进行多模态推理与行动

计算机视觉与模式识别 2023-03-22 v1 计算与语言 机器学习

摘要

我们提出MM-REACT,一种将ChatGPT与一组视觉专家集成的系统范式,以实现多模态推理与行动。在本文中,我们定义并探索了一系列引人求解的高级视觉任务,但这些任务可能超出已有视觉与视觉-语言模型的能力。为实现此类高级视觉智能,MM-REACT引入了一种文本提示设计,能够表示文本描述、文本化空间坐标以及用于图像和视频等密集视觉信号的对齐文件名。MM-REACT的提示设计允许语言模型接受、关联并处理多模态信息,从而促进ChatGPT与各种视觉专家的协同组合。零样本实验证明了MM-REACT在解决所关注能力方面的有效性,及其在需要高级视觉理解的不同场景中的广泛应用。此外,我们讨论并比较了MM-REACT的系统范式与一种通过联合微调扩展语言模型至多模态场景的替代方法。代码、演示、视频与可视化可在 https://multimodal-react.github.io/ 获取。

关键词

引用

@article{arxiv.2303.11381,
  title  = {MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action},
  author = {Zhengyuan Yang and Linjie Li and Jianfeng Wang and Kevin Lin and Ehsan Azarnasab and Faisal Ahmed and Zicheng Liu and Ce Liu and Michael Zeng and Lijuan Wang},
  journal= {arXiv preprint arXiv:2303.11381},
  year   = {2023}
}