面向长视频的内存高效持续学习目标分割
计算机视觉与模式识别
2024-02-15 v2 人工智能
摘要
近期最先进的半监督视频目标分割(VOS)方法表明,在分割当前帧时利用前序帧信息可显著提升目标分割精度。尤其,此类基于记忆的方法能更有效地应对外观变化(表征漂移)或遮挡。理想情况下,为获得最佳性能,在线 VOS 方法需将全部或大部分前序帧(或其提取信息)存于内存,并用于后续帧的在线学习。该方案对长视频不可行,因为所需内存无界增长,且当内存受限、目标对象在视频中经历反复表征漂移时此类方法会失效。我们提出两种新技术,在降低在线 VOS 方法内存需求的同时提升其对长视频的建模精度与泛化性。受持续学习技术在保留已学知识方面成功的启发,我们提出门控正则化持续学习(GRCL),可提升任意受限内存下在线 VOS 的性能;以及基于重建的内存选择持续学习(RMSCL),使在线 VOS 方法能高效利用内存中存储的信息。我们还分析了两种所提方法混合组合的性能。实验结果表明,所提方法能将在线 VOS 模型性能提升逾 8%,在长视频数据集上鲁棒性更强,同时在 DAVIS16、DAVIS17 和 YouTube-VOS18 等短视频数据集上保持相当性能。
引用
@article{arxiv.2309.15274,
title = {Memory-Efficient Continual Learning Object Segmentation for Long Video},
author = {Amir Nazemi and Mohammad Javad Shafiee and Zahra Gharaee and Paul Fieguth},
journal= {arXiv preprint arXiv:2309.15274},
year = {2024}
}