HQ-SMem:基于内存高效对象嵌入、选择性更新与自监督蒸馏反馈的视频分割与跟踪
计算机视觉与模式识别
2025-07-28 v1
摘要
视频对象分割(VOS)是众多计算机视觉应用的基础,包括监控、自动驾驶、机器人和生成式视频编辑。然而,现有的VOS模型常常在精确的掩码描绘、可变形对象、拓扑变形对象、跟踪漂移以及长视频序列方面存在挑战。本文提出了HQ-SMem(High Quality video segmentation and tracking using Smart Memory),一种新颖的方法,通过解决这些限制,提升VOS基础模型的性能。我们的方法包含三个关键创新点:(i)利用高质量掩码的SAM(SAM-HQ)以及基于外观的候选选择机制,以细化粗糙的分割掩码,改善对象边界;(ii)实现动态智能内存机制,通过选择性存储相关关键帧并丢弃冗余帧,优化长视频的内存使用和处理效率;(iii)动态更新外观模型,以有效处理复杂的拓扑变形并减少视频中的漂移。这些贡献缓解了现有VOS模型的多个局限,包括背景像素混入的粗糙分割、固定的内存更新计划、对漂移和遮挡的脆弱性,以及SAM的提示模糊问题。对多个公开数据集和最新基础跟踪器进行的大量实验表明,我们的方法在VOTS和VOTSt 2024数据集上始终稳居前两名。此外,HQ-SMem在长视频数据集和LVOS上设立了新纪录,展示了其在复杂多对象动态持续持续时间内处理具有挑战性情景的有效性。
引用
@article{arxiv.2507.18921,
title = {HQ-SMem: Video Segmentation and Tracking Using Memory Efficient Object Embedding With Selective Update and Self-Supervised Distillation Feedback},
author = {Elham Soltani Kazemi and Imad Eddine Toubal and Gani Rahmon and Jaired Collins and K. Palaniappan},
journal= {arXiv preprint arXiv:2507.18921},
year = {2025}
}
备注
submit/6651762