中文

HiTeA:分层时间感知的视频-语言预训练

计算机视觉与模式识别 2023-01-02 v1 计算与语言 多媒体

摘要

视频-语言预训练提升了多种下游视频-语言任务的性能。然而,以往大多数方法直接继承或改编典型的图像-语言预训练范式来进行视频-语言预训练,因而未能充分利用视频的独特特性,即时间性。本文提出一种分层时间感知的视频-语言预训练框架 HiTeA,并设计两个新颖的预训练任务,用于建模时刻与文本之间的跨模态对齐以及视频-文本对的时间关系。具体而言,我们提出跨模态时刻探索任务以探索视频中的时刻,从而得到精细的视频时刻表示。此外,通过以不同时间分辨率将视频-文本对作为整体进行对齐,多模态时间关系探索任务捕捉了固有的时间关系。进一步地,我们引入打乱测试来评估数据集与视频-语言预训练模型对时间的依赖性。我们在 15 个成熟的视频-语言理解与生成任务上取得了最先进(SOTA)结果,尤其是在时间导向的数据集(如 SSv2-Template 和 SSv2-Label)上分别实现了 8.6% 和 11.1% 的提升。HiTeA 在以零样本方式直接迁移至下游任务时也展现出强大的泛化能力。模型与演示将在 ModelScope 上提供。

关键词

引用

@article{arxiv.2212.14546,
  title  = {HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training},
  author = {Qinghao Ye and Guohai Xu and Ming Yan and Haiyang Xu and Qi Qian and Ji Zhang and Fei Huang},
  journal= {arXiv preprint arXiv:2212.14546},
  year   = {2023}
}