SeqTR:一种简洁而通用的视觉定位网络
计算机视觉与模式识别
2022-11-29 v2
摘要
在本文中,我们提出一种简洁而通用的网络 SeqTR,用于视觉定位任务,例如短语定位、指代表达理解(REC)和分割(RES)。视觉定位的典型范式通常需要设计网络架构和损失函数方面的大量专业知识,难以跨任务泛化。为简化并统一建模,我们将视觉定位视为以图像和文本输入为条件的点预测问题,其中边界框或二值掩码均表示为离散坐标词元的序列。在此范式下,视觉定位任务在我们的 SeqTR 网络中得以统一,无需任务特定的分支或头,例如用于 RES 的卷积掩码解码器,这极大降低了多任务建模的复杂度。此外,SeqTR 对所有任务共享相同的优化目标,采用简单的交叉熵损失,进一步降低了部署手工设计损失函数的复杂度。在五个基准数据集上的实验表明,所提出的 SeqTR 优于(或与)现有 SOTA 方法相当,证明一种简洁而通用的视觉定位方法确实是可行的。源代码见 https://github.com/sean-zhuh/SeqTR。
引用
@article{arxiv.2203.16265,
title = {SeqTR: A Simple yet Universal Network for Visual Grounding},
author = {Chaoyang Zhu and Yiyi Zhou and Yunhang Shen and Gen Luo and Xingjia Pan and Mingbao Lin and Chao Chen and Liujuan Cao and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2203.16265},
year = {2022}
}
备注
21 pages, 8 figures