中文

ONE-PEACE:探索面向无限模态的统一通用表征模型

计算机视觉与模式识别 2023-05-19 v1 计算与语言 声音 音频与语音处理

摘要

在这项工作中,我们探索了一种可扩展的构建面向无限模态的通用表征模型的方法。我们发布了 ONE-PEACE,一个具有 4B 参数的高度可扩展模型,可无缝对齐并整合视觉、音频和语言模态的表征。ONE-PEACE 的架构由模态适配器、共享自注意力层和模态 FFN 组成。该设计允许通过添加适配器和 FFN 轻松扩展新模态,同时通过网络自注意力层实现多模态融合。为预训练 ONE-PEACE,我们开发了两种模态无关预训练任务:跨模态对齐对比和模态内去噪对比,它们同时对齐不同模态的语义空间并捕获模态内的细粒度细节。凭借易于扩展的架构和预训练任务,ONE-PEACE 有潜力扩展到无限模态。在不使用任何视觉或语言预训练模型进行初始化的情况下,ONE-PEACE 在广泛的单模态和多模态任务上取得领先结果,包括图像分类(ImageNet)、语义分割(ADE20K)、音频-文本检索(AudioCaps、Clotho)、音频分类(ESC-50、FSD50K、VGGSound)、音频问答(AVQA)、图像-文本检索(MSCOCO、Flickr30K)和视觉定位(RefCOCO/+/g)。代码见 https://github.com/OFA-Sys/ONE-PEACE。

关键词

引用

@article{arxiv.2305.11172,
  title  = {ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities},
  author = {Peng Wang and Shijie Wang and Junyang Lin and Shuai Bai and Xiaohuan Zhou and Jingren Zhou and Xinggang Wang and Chang Zhou},
  journal= {arXiv preprint arXiv:2305.11172},
  year   = {2023}
}

备注

30 pages, 9 figures, 18 tables