中文

Visual ChatGPT:借助视觉基础模型进行对话、绘图与编辑

计算机视觉与模式识别 2023-03-09 v1

摘要

ChatGPT 正引起跨领域关注,因为它提供了具有卓越对话能力与跨域推理能力的语言接口。然而,由于 ChatGPT 以语言训练,目前无法处理或生成视觉世界中的图像。与此同时,视觉基础模型(如 Visual Transformers 或 Stable Diffusion)虽展现出强大的视觉理解与生成能力,但仅是具备单轮固定输入输出、针对特定任务的专家。为此,我们构建了名为 \textbf{Visual ChatGPT} 的系统,融合不同视觉基础模型,使用户能够通过以下方式人与 ChatGPT 交互:1) 发送与接收不仅限于语言还包括图像;2) 提供需要多个 AI 模型多步协作的复杂视觉问题或视觉编辑指令;3) 提供反馈并要求修正结果。我们设计了一系列提示将视觉模型信息注入 ChatGPT,兼顾多输入/输出模型与需要视觉反馈的模型。实验表明,Visual ChatGPT 借助视觉基础模型开启了研究 ChatGPT 视觉角色的大门。我们的系统已公开于 \url{https://github.com/microsoft/visual-chatgpt}。

关键词

引用

@article{arxiv.2303.04671,
  title  = {Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models},
  author = {Chenfei Wu and Shengming Yin and Weizhen Qi and Xiaodong Wang and Zecheng Tang and Nan Duan},
  journal= {arXiv preprint arXiv:2303.04671},
  year   = {2023}
}