中文

HierVL:学习层次化视频-语言嵌入

计算机视觉与模式识别 2023-06-09 v2

摘要

视频-语言嵌入是为视觉表征注入语义的一种有前景的途径,但现有方法仅捕捉长达数秒的视频片段与其伴随文本之间的短期关联。我们提出 HierVL,一种新颖的层次化视频-语言嵌入,同时考虑长期与短期关联。作为训练数据,我们采用带有时间戳的人类动作文本描述以及整个长视频活动的高层文本摘要(如 Ego4D 中所提供的)的视频。我们引入一种层次化对比训练目标,在片段级和视频级上均鼓励文本-视觉对齐。片段级约束利用逐步描述来捕捉该时刻正在发生什么,而视频级约束利用摘要文本来捕捉为何发生,即活动的更广阔背景与行为者的意图。我们的层次化方案产生了一种优于其单级对应物的片段表征,以及一种在长期视频建模任务上取得 SotA 结果的长期视频表征。HierVL 成功迁移到多个具有挑战性的下游任务(EPIC-KITCHENS-100、Charades-Ego、HowTo100M),在零样本和微调设定下均如此。

关键词

引用

@article{arxiv.2301.02311,
  title  = {HierVL: Learning Hierarchical Video-Language Embeddings},
  author = {Kumar Ashutosh and Rohit Girdhar and Lorenzo Torresani and Kristen Grauman},
  journal= {arXiv preprint arXiv:2301.02311},
  year   = {2023}
}

备注

CVPR 2023