SAMSON:LSVOS 2025 视频对象分割挑战中位第 3 名解决方案
计算机视觉与模式识别
2025-09-23 v1
摘要
大规模视频对象分割 (LSVOS) 旨在准确跟踪和分割长视频序列中的对象,其中主要挑战包括对象重现、小尺寸目标、严重遮挡以及拥挤场景。现有方法主要采用基于 SAM2 的框架,结合多种记忆机制以实现复杂视频掩码生成。本报告提出了 Segment Anything with Memory Strengthened Object Navigation (SAMSON),即 ICCV 2025 MOSE 挑战赛中位第 3 名的解决方案,通过整合最新 VOS 模型的优势,构建有效的方法论。为处理在 MOSE 中出现的视觉相似实例和长期对象消失问题,我们引入长期记忆模块,以实现可靠的对象重识别。此外,我们采用 SAM2Long 作为后处理策略,以减少误差积累并提升长视频序列中的分割稳定性。本方法在测试集排行榜中以 0.8427 的最终性能取得佳绩。
引用
@article{arxiv.2509.17500,
title = {SAMSON: 3rd Place Solution of LSVOS 2025 VOS Challenge},
author = {Yujie Xie and Hongyang Zhang and Zhihui Liu and Shihai Ruan},
journal= {arXiv preprint arXiv:2509.17500},
year = {2025}
}