中文

SegVG:将对象边界框转化为分割以实现视觉 grounding

计算机视觉与模式识别 2024-07-09 v2

摘要

与目标检测不同,视觉 grounding 处理的是为每个文本-图像对检测一个边界框。每个文本-图像数据仅提供一个稀疏的监督信号。尽管已有方法取得了显著成果,但它们仅将边界框注释用作回归ground truth,导致性能次优。本文提出 SegVG,一种 novel 方法将边界框级注释转化为分割信号,以提供额外的像素级监督。具体而言,我们提出了多层多任务编码器-解码器作为目标 grounding 阶段,在每一解码层中学习回归查询和多个分割查询分别对边界框进行回归和分割。这种方法使我们能够迭代地将注释用作回归和像素级分割的信号。此外,由于主干网络通常是通过单模态任务预训练参数初始化的,而回归和分割的查询是静态可学习嵌入,因此存在三类特征之间的领域差异,这会损害后续目标 grounding。为缓解此差异,我们引入三角对齐模块,通过三角注意力机制对查询、文本和视觉标记进行更新,使其共享同一空间。广泛的实验在五个广泛使用的数据集上验证了我们的 SOTA 性能。

关键词

引用

@article{arxiv.2407.03200,
  title  = {SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding},
  author = {Weitai Kang and Gaowen Liu and Mubarak Shah and Yan Yan},
  journal= {arXiv preprint arXiv:2407.03200},
  year   = {2024}
}

备注

Accepted to ECCV 2024