中文

Kosmos-2:将多模态大语言模型锚定至现实世界

计算与语言 2023-07-14 v3 计算机视觉与模式识别

摘要

我们介绍 Kosmos-2,一种多模态大语言模型(MLLM),赋予其感知物体描述(如边界框)并将文本锚定至视觉世界的新能力。具体而言,我们将指代表达表示为 Markdown 中的链接,即 ``[text span](bounding boxes)'',其中物体描述为位置 token 的序列。结合多模态语料,我们构建了大规模锚定图像-文本对数据(称为 GrIT)来训练模型。除 MLLMs 已有能力(如感知通用模态、遵循指令、进行上下文学习)外,Kosmos-2 将锚定能力整合进下游应用。我们在广泛任务上评估 Kosmos-2,包括(i)多模态锚定,如指代表达理解、短语锚定;(ii)多模态指代,如指代表达生成;(iii)感知-语言任务;(iv)语言理解与生成。本工作为具身 AI 的发展奠定基础,并启示语言、多模态感知、动作与世界建模的大融合,这是迈向通用人工智能的关键一步。代码与预训练模型见 https://aka.ms/kosmos-2。

关键词

引用

@article{arxiv.2306.14824,
  title  = {Kosmos-2: Grounding Multimodal Large Language Models to the World},
  author = {Zhiliang Peng and Wenhui Wang and Li Dong and Yaru Hao and Shaohan Huang and Shuming Ma and Furu Wei},
  journal= {arXiv preprint arXiv:2306.14824},
  year   = {2023}
}

备注

20 pages