Unified-IO:一个面向视觉、语言和多模态任务的统一模型
计算机视觉与模式识别
2022-10-06 v2
摘要
我们提出了 Unified-IO,一个能执行大量 AI 任务的模型,这些任务涵盖从经典的计算机视觉任务(包括姿态估计、目标检测、深度估计和图像生成),到视觉与语言任务(如区域描述和指代表达),再到自然语言处理任务(如问答和释义)。为如此多样的任务开发一个统一的模型带来了独特的挑战,因为每个任务涉及异构的输入和输出,包括 RGB 图像、逐像素映射、二值掩码、边界框和语言。我们通过将每种支持的输入和输出同质化为离散词汇标记序列来实现这种统一。这种跨所有任务的通用表示使我们能够训练一个单一的基于 Transformer 的架构,并在视觉和语言领域的 90 多个不同数据集上进行联合训练。Unified-IO 是首个能够在 GRIT 基准测试中执行全部 7 项任务的模型,并在 NYUv2-Depth、ImageNet、VQA2.0、OK-VQA、Swig、VizWizGround、BoolQ 和 SciTail 等 16 个不同基准测试中产生了优异的结果,且无需针对特定任务进行微调。Unified-IO 的代码和演示可在以下网址获取:https://unified-io.allenai.org。
引用
@article{arxiv.2206.08916,
title = {Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks},
author = {Jiasen Lu and Christopher Clark and Rowan Zellers and Roozbeh Mottaghi and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:2206.08916},
year = {2022}
}