LMMs 的黎明:基于 GPT-4V(ision) 的初步探索
计算机视觉与模式识别
2023-10-12 v2 计算与语言
摘要
大型多模态模型(LMMs)通过赋予大型语言模型(LLMs)视觉理解等多感官技能来扩展其能力,以实现更强的通用智能。在本文中,我们分析了最新的模型 GPT-4V(ision),以加深对 LMMs 的理解。分析聚焦于 GPT-4V 能够执行的引人入胜的任务,包含用于探查 GPT-4V 能力质量与通用性的测试样本、其支持的输入与工作模式,以及提示该模型的有效方式。在我们探索 GPT-4V 的方法中,我们策划并整理了一组涵盖多种领域与任务的精心设计的定性样本。来自这些样本的观察表明,GPT-4V 处理任意交错多模态输入的空前能力与其能力的通用性共同使 GPT-4V 成为一个强大的多模态通才系统。此外,GPT-4V 理解绘制在输入图像上的视觉标记的独特能力可催生如视觉指代提示(visual referring prompting)等新人机交互方法。我们以对基于 GPT-4V 系统的新兴应用场景与未来研究方向的深入讨论作结本报告。我们希望这一初步探索能启发未来关于下一代多模态任务构建、利用和增强 LMMs 以解决现实世界问题的新方法,以及更好地理解多模态基础模型的研究。最后,我们承认我们所研究的模型仅系 OpenAI 创新工作的产物,其开发应完全归功于他们。请参阅 GPT-4V 贡献论文以了解作者身份与荣誉归属:https://cdn.openai.com/contributions/gpt-4v.pdf
引用
@article{arxiv.2309.17421,
title = {The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)},
author = {Zhengyuan Yang and Linjie Li and Kevin Lin and Jianfeng Wang and Chung-Ching Lin and Zicheng Liu and Lijuan Wang},
journal= {arXiv preprint arXiv:2309.17421},
year = {2023}
}