面向视觉任务的统一序列接口
计算机视觉与模式识别
2022-10-18 v2 计算与语言
机器学习
摘要
虽然语言任务天然地表达于单一、统一的建模范式之中,即生成 token 序列,但在计算机视觉中情况并非如此。因此,针对不同视觉任务出现了大量各异的架构与损失函数。在本工作中,我们表明如果以共享的像素到序列接口来表述,一组多样的“核心”计算机视觉任务也可以被统一。我们聚焦于四项任务,即目标检测、实例分割、关键点检测和图像描述,它们均具有不同类型的输出,例如边界框或稠密掩码。尽管如此,通过将每项任务的输出表述为带有统一接口的离散 token 序列,我们表明可以用单一模型架构和损失函数在所有这些任务上训练一个神经网络,而无需任务特定的定制。为解决特定任务,我们使用一个短提示作为任务描述,序列输出会适配该提示从而产生任务特定的输出。我们展示这样的模型相较于成熟的任务特定模型能够取得有竞争力的性能。
引用
@article{arxiv.2206.07669,
title = {A Unified Sequence Interface for Vision Tasks},
author = {Ting Chen and Saurabh Saxena and Lala Li and Tsung-Yi Lin and David J. Fleet and Geoffrey Hinton},
journal= {arXiv preprint arXiv:2206.07669},
year = {2022}
}
备注
The first three authors contributed equally