中文

GRiT:一种用于对象理解的区域到文本生成式 Transformer

计算机视觉与模式识别 2022-12-02 v1

摘要

本文提出一种生成式区域到文本 Transformer,GRiT,用于对象理解。GRiT 的核心思想是将对象理解表述为 <区域, 文本> 对,其中区域定位对象而文本描述对象。例如,目标检测中的文本表示类别名称,而密集描述中的文本指代描述性句子。具体而言,GRiT 由一个提取图像特征的视觉编码器、一个定位前景对象的提取器和一个生成开放集对象描述的文本解码器组成。借助相同的模型架构,GRiT 不仅可通过简单名词理解对象,还能通过包含对象属性或动作的描述性句子理解对象。在实验上,我们将 GRiT 应用于目标检测与密集描述任务。GRiT 在 COCO 2017 test-dev 上以 60.4 AP 完成目标检测,在 Visual Genome 上以 15.5 mAP 完成密集描述。代码见 https://github.com/JialianW/GRiT

关键词

引用

@article{arxiv.2212.00280,
  title  = {GRiT: A Generative Region-to-text Transformer for Object Understanding},
  author = {Jialian Wu and Jianfeng Wang and Zhengyuan Yang and Zhe Gan and Zicheng Liu and Junsong Yuan and Lijuan Wang},
  journal= {arXiv preprint arXiv:2212.00280},
  year   = {2022}
}