Pix2Seq:一种用于目标检测的语言建模框架
计算机视觉与模式识别
2022-03-29 v2 人工智能
计算与语言
机器学习
摘要
我们提出 Pix2Seq,一种简单且通用的目标检测框架。不同于显式整合关于该任务的先验知识的现有方法,我们将目标检测视为以观测像素输入为条件的语言建模任务。目标描述(例如边界框与类别标签)被表示为离散 token 的序列,我们训练神经网络以感知图像并生成所需序列。我们的方法主要基于如下直觉:若神经网络知晓物体位于何处以及是什么,我们只需教会它如何将其读出。除使用任务特定的数据增强外,我们的方法对任务做出极少的假设,然而与高度专门化且精心优化的检测算法相比,其在具有挑战性的 COCO 数据集上取得了具有竞争力的结果。
引用
@article{arxiv.2109.10852,
title = {Pix2seq: A Language Modeling Framework for Object Detection},
author = {Ting Chen and Saurabh Saxena and Lala Li and David J. Fleet and Geoffrey Hinton},
journal= {arXiv preprint arXiv:2109.10852},
year = {2022}
}
备注
ICLR'22. Code and pretrained models at https://github.com/google-research/pix2seq