中文

对比语言视频时间预训练

计算机视觉与模式识别 2024-06-06 v1

摘要

我们介绍了LAVITI,这是一种通过对比学习学习长视频中语言、视频和时间表示的新方法。与基于视频文本对的预训练方法(如EgoVLP)不同,LAVITI旨在通过从未剪辑的视频中提取有意义的时刻来对齐语言、视频和时间特征。我们的模型采用一组可学习的时刻查询来解码 clip 级别的视觉、语言和时间特征。除了视觉和语言对齐外,我们引入相对时间嵌入(TE)来表示视频中的时间戳,这使得对比学习时间成为可能。与传统方法显著不同,特定时间戳的预测通过计算预测TE与所有TE之间的相似度得分来实现。此外,现有方法主要为短视频设计,因为计算复杂度和内存占用较高。我们的方法可以在仅用8台NVIDIA RTX-3090 GPU在一天内对Ego4D数据集进行训练。在CharadesEgo动作识别上,我们实现了最先进的效果。

关键词

引用

@article{arxiv.2406.02631,
  title  = {Contrastive Language Video Time Pre-training},
  author = {Hengyue Liu and Kyle Min and Hector A. Valdez and Subarna Tripathi},
  journal= {arXiv preprint arXiv:2406.02631},
  year   = {2024}
}

备注

CVPR EgoVis Workshop 2024 extended abstract