中文

被注意力背叛:一种简洁而有效的自监督视频对象分割方法

计算机视觉与模式识别 2024-07-09 v2

摘要

在本文中,我们提出一种简洁而有效的自监督视频对象分割(VOS)方法。我们的核心见解是,DINO 预训练 Transformer 中固有的结构依赖关系可被利用来建立视频中鲁棒的时空对应。此外,对该对应线索进行简单聚类即足以产生具有竞争力的分割结果。先前的自监督 VOS 技术主要借助辅助模态或利用迭代槽注意力来辅助对象发现,这限制了其普遍适用性并带来更高的计算需求。为应对这些挑战,我们开发了一种简化架构,其利用 DINO 预训练 Transformer 中涌现的对象性,避开了额外模态或槽注意力的需要。具体而言,我们首先引入单个时空 Transformer 块来处理逐帧 DINO 特征,并以自注意力形式建立时空依赖。随后,利用这些注意力图,我们实施层次聚类以生成对象分割掩码。为以完全自监督方式训练时空块,我们采用语义与动态运动一致性并结合熵归一化。我们的方法在多个无监督 VOS 基准上展现出最优性能,尤其在 DAVIS-17-Unsupervised 与 YouTube-VIS-19 等复杂真实世界多对象视频分割任务中表现突出。代码与模型检查点将于 https://github.com/shvdiwnkozbw/SSL-UVOS 发布。

关键词

引用

@article{arxiv.2311.17893,
  title  = {Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object Segmentation},
  author = {Shuangrui Ding and Rui Qian and Haohang Xu and Dahua Lin and Hongkai Xiong},
  journal= {arXiv preprint arXiv:2311.17893},
  year   = {2024}
}

备注

ECCV 2024 Camera Ready