中文

基于不相交监督的稠密视频物体描述生成

计算机视觉与模式识别 2024-10-16 v3

摘要

我们提出一项新任务及模型用于稠密视频物体描述生成——检测、跟踪并描述视频中物体的轨迹。该任务统一了视频中的空间与时间定位,同时还需要由自然语言最佳描述的细粒度视觉理解。我们提出一个统一模型,并展示端到端方法比结合最先进检测、跟踪与描述生成模型的多阶段流水线更准确且时间上更连贯。此外,我们提出基于不相交任务混合的训练策略,使我们能利用多样化大规模数据集来监督模型的不同部分。尽管每个预训练任务仅提供弱监督,但它们互补,结合后产生显著的零样本能力,并作为额外微调以进一步提升准确率的强初始化。我们精心设计了捕捉任务所有成分的新指标,并展示如何将现有视频定位数据集(如 VidSTG 和 VLN)重新用于我们的新任务。我们表明模型在该新任务上优于多个强基线。此外,我们可将模型应用于空间定位任务,在 VidSTG 和 VLN 上超越先前最先进水平,而无需显式训练。代码见 https://github.com/google-research/scenic/tree/main/scenic/projects/densevoc。

关键词

引用

@article{arxiv.2306.11729,
  title  = {Dense Video Object Captioning from Disjoint Supervision},
  author = {Xingyi Zhou and Anurag Arnab and Chen Sun and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2306.11729},
  year   = {2024}
}

备注

Code is available at https://github.com/google-research/scenic/tree/main/scenic/projects/densevoc