中文

用于自动驾驶中非模态视频实例分割的基础模型

计算机视觉与模式识别 2024-09-24 v1

摘要

在本工作中,我们研究面向自动驾驶的非模态视频实例分割。以往的工作依赖于借鉴标准视频实例分割技术、在完全标注的视频数据上训练的方法来执行非模态视频实例分割。此类非模态标注的视频数据获取困难且昂贵,且所得方法在实例分割与跟踪性能之间存在权衡。为了在很大程度上解决这一问题,我们提议研究基础模型在该任务上的应用。更准确地说,我们利用 Segment Anything Model (SAM) 的丰富知识,同时将其微调以适应非模态实例分割任务。给定初始的视频实例分割,我们从可见掩码中采样点来提示我们的非模态 SAM。我们使用点记忆库来存储这些点。如果先前观察到的实例在后续帧中未被预测,我们从点记忆库中检索其最近的点,并使用点跟踪方法将这些点跟踪到当前帧,同时结合对应的上一个非模态实例掩码。这样,尽管我们的方法基于非模态实例分割,我们仍然获得了视频级的非模态实例分割结果。我们最终提出的 S-AModal 方法在非模态视频实例分割中取得了 SOTA 结果,同时免除了对基于视频的非模态标签的需求。S-AModal 的代码可在 https://github.com/ifnspaml/S-AModal 获取。

关键词

引用

@article{arxiv.2409.14095,
  title  = {Foundation Models for Amodal Video Instance Segmentation in Automated Driving},
  author = {Jasmin Breitenstein and Franz Jünger and Andreas Bär and Tim Fingscheidt},
  journal= {arXiv preprint arXiv:2409.14095},
  year   = {2024}
}

备注

accepted at ECCV VCAD Workshop 2024