迈向计算机视觉中的 AGI:来自 GPT 与大语言模型的经验
计算机视觉与模式识别
2023-06-16 v1 人工智能
摘要
AI 社区一直追求被称为通用人工智能(AGI)的算法,以适用于任意真实世界问题。近来,由大语言模型(LLMs)驱动的聊天系统涌现,并迅速成为在自然语言处理(NLP)中实现 AGI 的有前景方向,但计算机视觉(CV)中通往 AGI 的路径仍不明朗。或可将困境归因于视觉信号较语言信号更复杂,而我们旨在找出具体原因,并吸收 GPT 与 LLMs 的经验以解决问题。本文从 AGI 的概念定义出发,简要回顾 NLP 如何通过聊天系统解决广泛任务。该分析启示我们,统一是 CV 的下一重要目标。然而,尽管已有诸多努力,CV 仍远未达成如 GPT 般自然整合所有任务的系统。我们指出,CV 的本质弱点在于缺乏从环境中学习的范式,而 NLP 已在文本世界完成此任务。我们进而构想一流程:将 CV 算法(即智能体)置于世界尺度、可交互环境中,预训练其依据动作预测未来帧,再以指令微调以完成各类任务。我们期待大量研究与工程努力推进并扩展该想法,并分享对未来研究方向的见解。
引用
@article{arxiv.2306.08641,
title = {Towards AGI in Computer Vision: Lessons Learned from GPT and Large Language Models},
author = {Lingxi Xie and Longhui Wei and Xiaopeng Zhang and Kaifeng Bi and Xiaotao Gu and Jianlong Chang and Qi Tian},
journal= {arXiv preprint arXiv:2306.08641},
year = {2023}
}
备注
17 pages, 14 figures, technical report, expected to be updated in the near future