中文

STOA-VLP:面向视频语言预训练的物体与动作时空建模

计算机视觉与模式识别 2023-11-10 v2 计算与语言

摘要

尽管大规模视频语言预训练模型(通常在视频与文本间建立全局对齐)在各种下游任务上取得了显著进展,但在预训练阶段引入细粒度信息的思路尚未得到充分探索。本文提出 STOA-VLP,一种在时空维度上联合建模物体与动作信息的预训练框架。具体而言,模型将跨帧的物体轨迹与来自视频的多种动作特征视为细粒度特征。此外,我们设计了两个辅助任务以更好地将两类信息融入视频语言模型的预训练过程。其一是动态物体-文本对齐任务,在物体轨迹与相关名词词元间建立更好的联系;其二是时空动作集合预测,通过预测文本中出现的动作引导模型生成一致的动作特征。在三个下游任务(视频描述生成、文本-视频检索、视频问答)上的大量实验证明了我们所提 STOA-VLP 的有效性(例如,相较先前方法,在 MSR-VTT 视频描述生成基准上 Rouge-L 提升 3.7,在 MSVD 视频问答基准上准确率提升 2.9%)。

关键词

引用

@article{arxiv.2302.09736,
  title  = {STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training},
  author = {Weihong Zhong and Mao Zheng and Duyu Tang and Xuan Luo and Heng Gong and Xiaocheng Feng and Bing Qin},
  journal= {arXiv preprint arXiv:2302.09736},
  year   = {2023}
}

备注

AAAI 2023, 7 pages, 3 figures