视频实例分割的Local2Global查询对齐
计算机视觉与模式识别
2025-07-29 v1
摘要
在线视频分割方法擅长处理长序列和捕捉渐变变化,因而适用于实际应用。然而,实现时序一致的预测仍具有挑战,尤其是面对在线传播中噪声的渐积累积、漂移、突发遮挡以及场景转换。本文引入Local2Global,一种用于视频实例分割的在线框架,展现出简单基线和纯粹在线方式的领先性能。基于DETR查询传播框架,我们提出两种新型查询:(1)捕获每个帧中初始对象特定空间特征的局部查询;以及(2)包含过去时空表示的全局查询。我们提出L2G-aligner,一种新型轻量级Transformer解码器,用于促进局部查询与全局查询的早期对齐。这种对齐使模型能够有效利用当前帧信息,同时保持时序一致性,实现帧之间平滑的过渡。此外,L2G-aligner集成于分割模型,无需额外复杂的启发式方法或记忆机制。广泛的在各种挑战性视频实例分割(VIS)和视频目标分割(VPS)数据集上的实验显示,我们的方法在简单在线训练下,凌驾于当前基准,无需任何额外装饰。例如,在ResNet-50主干网络下,我们在Youtube-VIS-19/-21数据集上分别实现了54.3和49.4 AP,在OVIS数据集上实现了37.0 AP。
引用
@article{arxiv.2507.20120,
title = {Local2Global query Alignment for Video Instance Segmentation},
author = {Rajat Koner and Zhipeng Wang and Srinivas Parthasarathy and Chinghang Chen},
journal= {arXiv preprint arXiv:2507.20120},
year = {2025}
}