中文

LVOS:一个面向长时视频对象分割的基准数据集

计算机视觉与模式识别 2023-08-21 v2

摘要

现有的视频对象分割(VOS)基准聚焦于仅持续约3-5秒且对象在大多数时间可见的短时视频。这些视频对实际应用的代表性不足,且长时数据集的缺失限制了VOS在真实场景应用中的进一步研究。因此,本文提出一个名为 \textbf{LVOS} 的新基准数据集,包含220个视频,总时长421分钟。据我们所知,LVOS是首个密集标注的长时VOS数据集。我们LVOS中的视频平均持续1.59分钟,是现有VOS数据集中视频时长的20倍。每个视频包含多种属性,尤其是来自真实环境的挑战,例如长时重现和跨时间相似对象。基于LVOS,我们评估了现有的视频对象分割算法,并提出了一种由三个互补记忆库组成的多样动态记忆网络(DDMemory),以充分利用时间信息。实验结果揭示了已有方法的优势与不足,指明了进一步研究的有前景方向。数据和代码见 https://lingyihongfd.github.io/lvos.github.io/。

关键词

引用

@article{arxiv.2211.10181,
  title  = {LVOS: A Benchmark for Long-term Video Object Segmentation},
  author = {Lingyi Hong and Wenchao Chen and Zhongying Liu and Wei Zhang and Pinxue Guo and Zhaoyu Chen and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2211.10181},
  year   = {2023}
}

备注

Accepted by ICCV 2023. Project page: https://lingyihongfd.github.io/lvos.github.io/