LVOS:大规模长期视频对象分割基准
计算机视觉与模式识别
2024-05-02 v2
摘要
视频对象分割(VOS)旨在区分和跟踪视频中的目标对象。尽管现有的VOS模型在准确性方面取得了优异性能,但现有的VOS基准主要聚焦于持续约5秒的短视频,其中对象在大部分时间内保持可见。然而,这些基准很好地代表了实际应用,缺乏长期数据集限制了VOS在真实场景中的进一步探索。因此,我们提出了一个新的基准,名为LVOS,包含720个视频,296,401个帧,407,945个高质量注释。LVOS中的视频平均持续1.14分钟,约为现有数据集中视频的5倍。每个视频包括各种属性,特别是来自野生环境的挑战,如长期重现和跨时间相似对象。与以前的基准相比,LVOS更好地反映了VOS模型在真实场景中的性能。我们在LVOS上评估了20个现有的VOS模型,采用4种不同设置进行全面分析。在LVOS上,这些模型会出现显著的性能下降,凸显了在真实世界场景中实现精确跟踪和分割的挑战。基于属性的分析表明,视频长度增加是精度下降的关键因素,突显了LVOS的关键作用。我们希望LVOS能够推动VOS在真实场景中的发展。数据和代码已在https://lingyihongfd.github.io/lvos.github.io/上提供。
引用
@article{arxiv.2404.19326,
title = {LVOS: A Benchmark for Large-scale Long-term Video Object Segmentation},
author = {Lingyi Hong and Zhongying Liu and Wenchao Chen and Chenzhi Tan and Yuang Feng and Xinyu Zhou and Pinxue Guo and Jinglun Li and Zhaoyu Chen and Shuyong Gao and Wei Zhang and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2404.19326},
year = {2024}
}
备注
LVOS V2