中文

用于指代视频对象分割的时间收集与分发机制

计算机视觉与模式识别 2023-09-08 v1

摘要

指代视频对象分割旨在依据自然语言表达式,在整个视频序列中分割出所指对象。这要求在全球视频层级将自然语言表达式与对象运动及其动态关联对齐,同时在帧层级分割对象。为实现该目标,我们提出同时维护一个全局所指 token 与一组对象查询序列,前者负责依据语言表达式捕获视频级所指,后者用于更好地在每帧中定位与分割对象。此外,为显式捕获对象运动及对象间时空跨模态推理,我们提出一种新颖的时间收集-分发机制,用于全局所指 token 与对象查询间的交互。具体而言,时间收集机制从对象查询到时间运动再到语言表达式,为所指 token 收集全局信息。反之,时间分发首先将所指 token 分发至所有帧的所指序列,随后在每帧中执行所指序列与对象查询间的高效跨帧推理。实验结果表明,我们的方法在所有基准上一致且显著优于 SOTA 方法。

关键词

引用

@article{arxiv.2309.03473,
  title  = {Temporal Collection and Distribution for Referring Video Object Segmentation},
  author = {Jiajin Tang and Ge Zheng and Sibei Yang},
  journal= {arXiv preprint arXiv:2309.03473},
  year   = {2023}
}

备注

Accepted by ICCV 2023; Project page: https://toneyaya.github.io/tempcd/