鲁棒可提示视频对象分割
计算机视觉与模式识别
2026-05-13 v1
摘要
可提示视频对象分割(PVOS)模型在输入受损情况下的性能大幅下降,这阻碍了PVOS在安全关键领域的部署。本文首次系统性研究鲁棒PVOS(RobustPVOS),构建了包含351个视频片段和超过2500个对象掩码的全新基准测试,涵盖真实世界的恶劣环境条件。同时,我们通过对现有VOS数据集应用多样且随时间变化的噪声,生成合成训练数据。此外,我们提出一种新型鲁棒PVOS方法,名为Memory-object-conditioned Gated-rank Adaptation(MoGA)。成功实现鲁棒PVOS的关键在于:有效处理对象特定的退化,并确保预测的时间一致性。MoGA利用跨帧维护的对象特定表示来条件化鲁棒化过程,从而在时间上保持一致性,使模型能够针对每个跟踪对象进行差异化处理。在我们的基准测试上进行的大量实验表明,MoGA有效提升了性能,在两种合成和真实数据集上均针对多种噪声类型实现了显著且持续的改进,为未来鲁棒PVOS研究奠定了强基准。我们的基准已公开于https://sohyun-l.github.io/RobustPVOS_project_page/。
引用
@article{arxiv.2605.12006,
title = {Robust Promptable Video Object Segmentation},
author = {Sohyun Lee and Yeho Gwon and Lukas Hoyer and Konrad Schindler and Christos Sakaridis and Suha Kwak},
journal= {arXiv preprint arXiv:2605.12006},
year = {2026}
}
备注
Accepted to CVPR 2026