中文

Unified-IO 2:扩展具有视觉、语言、音频和动作的自回归多模态模型

计算机视觉与模式识别 2023-12-29 v1 人工智能 计算与语言

摘要

我们提出Unified-IO 2,这是第一个能够理解和生成图像、文本、音频和动作的自回归多模态模型。为了统一不同模态,我们将输入和输出——图像、文本、音频、动作、边界框等——分词到一个共享语义空间,然后使用单个编码器-解码器Transformer模型进行处理。由于使用如此多样的模态进行训练具有挑战性,我们提出了各种架构改进以稳定模型训练。我们从头开始在一个来自多种来源的大型多模态预训练语料库上训练我们的模型,使用多模态去噪器混合目标。为了学习广泛的技能,例如遵循多模态指令,我们构建并在一个包含120个数据集(带有提示和增强)的集成上进行微调。通过单个统一模型,Unified-IO 2在GRIT基准上取得了最先进的性能,并在超过35个基准上取得了强劲结果,包括图像生成和理解、自然语言理解、视频和音频理解以及机器人操作。我们向研究社区发布所有模型。

关键词

引用

@article{arxiv.2312.17172,
  title  = {Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action},
  author = {Jiasen Lu and Christopher Clark and Sangho Lee and Zichen Zhang and Savya Khosla and Ryan Marten and Derek Hoiem and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2312.17172},
  year   = {2023}
}

备注

38 pages, 20 figures