基于不相交监督的稠密视频物体描述生成
计算机视觉与模式识别
2024-10-16 v3
摘要
我们提出一项新任务及模型用于稠密视频物体描述生成——检测、跟踪并描述视频中物体的轨迹。该任务统一了视频中的空间与时间定位,同时还需要由自然语言最佳描述的细粒度视觉理解。我们提出一个统一模型,并展示端到端方法比结合最先进检测、跟踪与描述生成模型的多阶段流水线更准确且时间上更连贯。此外,我们提出基于不相交任务混合的训练策略,使我们能利用多样化大规模数据集来监督模型的不同部分。尽管每个预训练任务仅提供弱监督,但它们互补,结合后产生显著的零样本能力,并作为额外微调以进一步提升准确率的强初始化。我们精心设计了捕捉任务所有成分的新指标,并展示如何将现有视频定位数据集(如 VidSTG 和 VLN)重新用于我们的新任务。我们表明模型在该新任务上优于多个强基线。此外,我们可将模型应用于空间定位任务,在 VidSTG 和 VLN 上超越先前最先进水平,而无需显式训练。代码见 https://github.com/google-research/scenic/tree/main/scenic/projects/densevoc。
引用
@article{arxiv.2306.11729,
title = {Dense Video Object Captioning from Disjoint Supervision},
author = {Xingyi Zhou and Anurag Arnab and Chen Sun and Cordelia Schmid},
journal= {arXiv preprint arXiv:2306.11729},
year = {2024}
}
备注
Code is available at https://github.com/google-research/scenic/tree/main/scenic/projects/densevoc