DeVOS:用于视频目标分割的流引导可变形 Transformer
计算机视觉与模式识别
2024-05-15 v1
摘要
近期关于视频目标分割的工作通过在当前帧与先前帧之间匹配密集的语义和实例级特征,在长时间传播中取得了显著成果。然而,全局特征匹配忽略了场景运动上下文,无法满足时间一致性。尽管一些方法引入局部匹配分支以实现平滑传播,但由于局部窗口的约束,它们无法对复杂的外观变化进行建模。在本文中,我们提出了 DeVOS(可变形 VOS),一种将基于记忆的匹配与运动引导传播相结合的视频目标分割架构,可实现稳定的长期建模和强时间一致性。对于短期局部传播,我们提出了一种新颖的注意力机制 ADVA(自适应可变形视频注意力),允许将相似性搜索区域适应于特定查询的语义特征,从而确保对复杂形状和尺度变化的鲁棒跟踪。DeVOS 采用光流获取场景运动特征,并将其作为强先验进一步注入可变形注意力中,以指导可学习的偏移量。我们的方法在 DAVIS 2017 val 和 test-dev(88.1%, 83.0%)以及 YouTube-VOS 2019 val(86.6%)上取得了顶尖性能,同时具有一致的运行速度和稳定的内存消耗。
引用
@article{arxiv.2405.08715,
title = {DeVOS: Flow-Guided Deformable Transformer for Video Object Segmentation},
author = {Volodymyr Fedynyak and Yaroslav Romanus and Bohdan Hlovatskyi and Bohdan Sydor and Oles Dobosevych and Igor Babin and Roman Riazantsev},
journal= {arXiv preprint arXiv:2405.08715},
year = {2024}
}