中文

OneVOS:以一体化 Transformer 框架统一视频目标分割

计算机视觉与模式识别 2024-03-14 v1

摘要

当前视频目标分割(VOS)方法通常包含特征提取、匹配、记忆管理和多目标聚合等阶段。近期先进模型要么以顺序方式对这些组件进行离散建模,要么通过子结构聚合优化组合流水线。然而,这些显式分阶段方法阻碍了 VOS 框架作为一个统一整体进行优化,导致处理复杂视频时能力受限且性能次优。本文提出 OneVOS,一个以一体化 Transformer(All-in-One Transformer)统一 VOS 核心组件的新颖框架。具体而言,为将上述所有模块统一到一个视觉 Transformer 中,我们将多目标的帧、掩码和记忆的所有特征建模为 Transformer 令牌,并通过灵活的注意力机制整体完成多目标的特征提取、匹配与记忆管理。此外,通过对原始注意力操作进行双重解耦,提出单向混合注意力(Unidirectional Hybrid Attention),以纠正 OneVOS 框架中存储令牌的语义错误和歧义。最后,为减轻存储负担并加速推理,我们提出动态令牌选择器(Dynamic Token Selector),揭示了 OneVOS 的工作机制,并自然衍生出更高效的 OneVOS 版本。大量实验证明了 OneVOS 的优越性,在 7 个数据集上取得了最先进的性能,尤其在复杂的 LVOS 和 MOSE 数据集上分别达到 70.1% 和 66.4% 的 J&FJ \& F 分数,比先前最先进方法分别高出 4.2% 和 7.0%。我们的代码将公开以供复现和进一步研究。

关键词

引用

@article{arxiv.2403.08682,
  title  = {OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework},
  author = {Wanyun Li and Pinxue Guo and Xinyu Zhou and Lingyi Hong and Yangji He and Xiangyu Zheng and Wei Zhang and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2403.08682},
  year   = {2024}
}

备注

19 pages, 7 figures