TAM-VT:用于分割与跟踪的变换感知多尺度视频 Transformer
计算机视觉与模式识别
2024-04-11 v2
摘要
随着更大数据集和更复杂、更贴近现实场景的可用性,视频目标分割(VOS)已成为一个日益重要的问题。这些场景涉及具有全局运动的视频(例如,在自我中心视角设置中),并描绘了经历刚性和非刚性(包括状态)变形的小目标。尽管已有许多近期方法被探索用于此任务,但这些数据特征仍然带来挑战。在本工作中,我们提出了一种新颖的、基于片段的 DETR 风格编码器-解码器架构,专注于系统性地分析和解决上述挑战。具体而言,我们提出了一种新颖的变换感知损失,将学习聚焦于视频中目标经历显著变形的部分——一种“软”难例挖掘形式。此外,我们提出了一种乘性时间编码记忆,超越了普通的加性位置编码,有助于在长视频中传播上下文。最后,我们将这些融入我们提出的整体多尺度视频 Transformer 中,通过多尺度记忆匹配和解码进行跟踪,以确保对长视频和小目标的敏感性和准确性。我们的模型能够以窗口化方式对长视频进行在线推理,通过将视频分解为片段并在它们之间传播上下文。我们说明了短片段长度和带有学习时间编码的较长记忆是提升性能的重要设计选择。总体而言,这些技术贡献使我们的模型能够在两个复杂的自我中心数据集——VISOR 和 VOST 上达到新的最先进(SoTA)性能,同时在传统 VOS 基准 DAVIS'17 上取得与 SoTA 相当的结果。一系列详细的消融实验验证了我们的设计选择,并提供了关于参数选择重要性及其对性能影响的见解。
引用
@article{arxiv.2312.08514,
title = {TAM-VT: Transformation-Aware Multi-scale Video Transformer for Segmentation and Tracking},
author = {Raghav Goyal and Wan-Cyuan Fan and Mennatullah Siam and Leonid Sigal},
journal= {arXiv preprint arXiv:2312.08514},
year = {2024}
}