STEP:逐像素分割与跟踪
计算机视觉与模式识别
2021-12-08 v2
摘要
为视频中每个像素分配语义类别和跟踪身份的任务称为视频全景分割。我们的工作是首个在真实世界设定下针对该任务的研究,要求在空间和时间域均进行密集解释。由于该任务的真值难以且昂贵地获取,现有数据集或是合成构建,或仅在短视频片段内稀疏标注。为克服此问题,我们引入一个包含KITTI-STEP和MOTChallenge-STEP两个数据集的新基准。这些数据集包含长视频序列,提供了具有挑战性的示例以及用于在真实条件下研究长期像素级精确分割与跟踪的测试平台。我们进一步提出一种新颖的评估指标分割与跟踪质量(STQ),它公平地平衡该任务的语义与跟踪方面,更适用于评估任意长度的序列。最后,我们提供若干基线以评估现有方法在这一新挑战性数据集上的现状。我们已公开数据集、指标、基准服务器和基线,希望这将启发未来研究。
引用
@article{arxiv.2102.11859,
title = {STEP: Segmenting and Tracking Every Pixel},
author = {Mark Weber and Jun Xie and Maxwell Collins and Yukun Zhu and Paul Voigtlaender and Hartwig Adam and Bradley Green and Andreas Geiger and Bastian Leibe and Daniel Cremers and Aljoša Ošep and Laura Leal-Taixé and Liang-Chieh Chen},
journal= {arXiv preprint arXiv:2102.11859},
year = {2021}
}
备注
Accepted to NeurIPS 2021 Track on Datasets and Benchmarks. Code: https://github.com/google-research/deeplab2