中文

联合建模特征、对应与压缩记忆用于视频对象分割

计算机视觉与模式识别 2025-05-01 v2

摘要

当前主流的视频对象分割(VOS)方法遵循先提取后匹配的流程,即先在当前帧与参考帧上独立提取特征,再在其间进行密集匹配。这种解耦流程将帧间信息传播限制于高层特征,阻碍了用于匹配的细粒度细节。此外,像素级匹配缺乏整体目标理解,易受热扰相似干扰物影响。为解决这些问题,我们提出一个统一的 VOS 框架,称为 JointFormer,用于联合建模特征提取、对应匹配与压缩记忆。核心联合建模块利用注意力同时从参考帧向当前帧与压缩记忆令牌提取并传播目标信息。该联合方案实现了超越高层特征空间的广泛多层传播,并促进鲁棒的实例区分性特征学习。为融入长期与整体目标信息,我们引入带定制在线更新机制的压缩记忆令牌,其聚合目标特征并以逐帧方式促进时间信息传播,增强全局建模一致性。我们的 JointFormer 在 DAVIS 2017 val/test-dev(89.7% 与 87.6%)基准与 YouTube-VOS 2018/2019 val(87.0% 与 87.0%)基准上取得新的最优性能,优于现有工作。为证明模型的泛化性,其进一步在四个具不同难度的新基准上评估,包括用于复杂场景的 MOSE、用于自我中心视频的 VISOR、用于复杂变换的 VOST 与用于长视频的 LVOS。

关键词

引用

@article{arxiv.2308.13505,
  title  = {Joint Modeling of Feature, Correspondence, and a Compressed Memory for Video Object Segmentation},
  author = {Jiaming Zhang and Yutao Cui and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2308.13505},
  year   = {2025}
}

备注

Accepted by TPAMI. Code and trained models are available at \url{https://github.com/MCG-NJU/JointFormer}