中文

时序感知的视频-语言预训练

计算机视觉与模式识别 2023-01-19 v1 人工智能

摘要

视频-语言预训练模型近来显著提升了多种多模态下游任务的表现。以往的主流工作主要采用对比学习来实现跨模态的全局特征对齐。然而,视频与文本之间的局部关联未被建模,限制了预训练模型的通用性,尤其是对于需要根据特定查询文本确定视频时间边界的任务。本文引入了一种新颖的文本-视频定位预训练任务,以实现细粒度的时间与语义对齐,使训练后的模型能够在给定文本描述时准确感知视频中的时间边界。具体而言,文本-视频定位包含时刻检索(根据文本描述预测视频的起止边界)和文本定位(将文本子集与视频特征进行匹配)。为生成时间边界,将若干视频中的帧特征手动合并为一个长视频序列,并与文本序列进行交互。通过该定位任务,我们的方法将细粒度的帧表示与词表示相连接,并隐式地区分单模态中不同实例的表示。值得注意的是,综合实验结果表明,我们的方法在多个基准上显著提升了当前最优性能,涵盖文本到视频检索、视频问答、视频描述生成、时序动作定位和时序时刻检索。代码将很快发布。

关键词

引用

@article{arxiv.2301.07463,
  title  = {Temporal Perceiving Video-Language Pre-training},
  author = {Fan Ma and Xiaojie Jin and Heng Wang and Jingjia Huang and Linchao Zhu and Jiashi Feng and Yi Yang},
  journal= {arXiv preprint arXiv:2301.07463},
  year   = {2023}
}