中文

PromptonomyViT:多任务提示学习利用合成场景数据改进视频 Transformer

计算机视觉与模式识别 2023-12-08 v3

摘要

动作识别模型通过引入场景级标注(如物体、其关系、3D 结构等)已取得令人印象深刻的成果。然而,为视频获取场景结构标注需要大量采集与标注工作,使这类方法的训练成本高昂。相比之下,由图形引擎生成的合成数据集为跨多任务生成场景级标注提供了强有力的替代方案。本工作中,我们提出一种利用合成场景数据改进视频理解的方法。我们提出一种面向视频 Transformer 的多任务提示学习方法,其中共享的视频 Transformer 骨干由针对每个任务的一小组专用参数增强。具体而言,我们添加一组“任务提示”,每个对应不同任务,并让每个提示预测任务相关标注。该设计使模型能在整个网络中捕获合成场景任务之间共享的信息,以及合成场景任务与真实视频下游任务之间共享的信息。我们将此方法称为“Promptonomy”,因为提示对任务相关结构进行建模。我们提出 PromptonomyViT 模型(PViT),一种利用“Promptonomy”方法融合合成数据中多种类型场景级信息的视频 Transformer。PViT 在多个视频理解任务和数据集上展现出强劲的性能提升。项目页面:\url{https://ofir1080.github.io/PromptonomyViT}

关键词

引用

@article{arxiv.2212.04821,
  title  = {PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data},
  author = {Roei Herzig and Ofir Abramovich and Elad Ben-Avraham and Assaf Arbelle and Leonid Karlinsky and Ariel Shamir and Trevor Darrell and Amir Globerson},
  journal= {arXiv preprint arXiv:2212.04821},
  year   = {2023}
}

备注

WACV 2024