中文

Video ReCap:长视频的递归 captioning

计算机视觉与模式识别 2024-05-20 v6

摘要

大多数视频 captioning 模型旨在处理几秒钟的短视频片段,并输出描述低级视觉概念(如物体、场景、原子动作)的文本。然而,大多数现实世界的视频持续数分钟或数小时,并具有跨越不同时间粒度的复杂层次结构。我们提出了 Video ReCap,一种递归视频 captioning 模型,能够处理长度差异巨大的视频输入(从 1 秒到 2 小时),并输出多个层次级别的视频 caption。该递归视频 - 语言架构利用了不同视频层次之间的协同效应,能够高效处理长达数小时的视频。我们采用课程学习训练方案来学习视频的层次结构,从描述原子动作的片段级 caption 开始,然后专注于片段级描述,最后生成数小时视频的摘要。此外,我们通过增强 Ego4D 数据集引入了 Ego4D-HCap 数据集,其中包含 8,267 个手动收集的长程视频摘要。我们的递归模型可以灵活地生成不同层次级别的 caption,同时也适用于其他复杂的视频理解任务,例如 EgoSchema 上的 VideoQA。数据、代码和模型可在以下网址获取:https://sites.google.com/view/vidrecap

关键词

引用

@article{arxiv.2402.13250,
  title  = {Video ReCap: Recursive Captioning of Hour-Long Videos},
  author = {Md Mohaiminul Islam and Ngan Ho and Xitong Yang and Tushar Nagarajan and Lorenzo Torresani and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2402.13250},
  year   = {2024}
}

备注

Accepted by CVPR 2024