BURST:一种统一视频中目标识别、分割与跟踪的基准
计算机视觉与模式识别
2022-11-23 v2
摘要
多个现有基准涉及视频中目标的跟踪与分割,例如视频目标分割(VOS)和多目标跟踪与分割(MOTS),但由于使用不同的基准数据集和指标(如J&F、mAP、sMOTSA),它们之间很少交互。因此,已发表的工作通常针对特定基准,且彼此不易比较。我们认为,开发能够处理多任务的通用方法需要这些研究子群体之间更强的凝聚力。本文旨在通过提出BURST来促进这一点,BURST是一个包含数千个多样化视频及高质量目标掩码的数据集,以及一个包含六项涉及视频中目标跟踪与分割任务的关联基准。所有任务均使用相同数据和可比较指标进行评估,这使研究者能够统一考虑它们,从而更有效地从不同任务的不同方法中汇聚知识。此外,我们展示了所有任务的若干基线,并表明一项任务的方法可应用于另一任务,且性能差异可量化、可解释。数据集标注与评估代码见:https://github.com/Ali2500/BURST-benchmark。
引用
@article{arxiv.2209.12118,
title = {BURST: A Benchmark for Unifying Object Recognition, Segmentation and Tracking in Video},
author = {Ali Athar and Jonathon Luiten and Paul Voigtlaender and Tarasha Khurana and Achal Dave and Bastian Leibe and Deva Ramanan},
journal= {arXiv preprint arXiv:2209.12118},
year = {2022}
}