连接图像与视频:一种用于大词汇表视频目标检测的简单学习框架
计算机视觉与模式识别
2022-12-21 v1
摘要
扩展目标分类体系是识别系统迈向鲁棒真实世界部署的重要步骤之一。自 LVIS 基准引入以来,我们在图像领域取得了显著进展。为在视频中延续这一成功,近期提出了新的视频基准 TAO。鉴于检测与跟踪领域近期令人鼓舞的结果,我们有兴趣将这两方面进展结合,构建强大的大词汇表视频跟踪器。然而,LVIS 与 TAO 中的监督 inherently 稀疏甚至缺失,给大词汇表跟踪器的训练带来了两个新挑战。首先,LVIS 中无跟踪监督,导致检测(用 LVIS 和 TAO)与跟踪(仅用 TAO)的学习不一致。其次,TAO 中的检测监督是部分的,导致在视频微调期间对缺失 LVIS 类别的灾难性遗忘。为应对这些挑战,我们提出了一种简单而有效的学习框架,充分利用所有可用训练数据来学习检测与跟踪,同时不丢失任何可识别的 LVIS 类别。借助这一新学习方案,我们展示了各类大词汇表跟踪器均能取得一致提升,在具挑战性的 TAO 基准上确立了强劲的基线结果。
引用
@article{arxiv.2212.10147,
title = {Bridging Images and Videos: A Simple Learning Framework for Large Vocabulary Video Object Detection},
author = {Sanghyun Woo and Kwanyong Park and Seoung Wug Oh and In So Kweon and Joon-Young Lee},
journal= {arXiv preprint arXiv:2212.10147},
year = {2022}
}
备注
ECCV 2022