中文

SOVC:面向主体的视频描述生成

计算机视觉与模式识别 2024-09-10 v2

摘要

根据用户需求描述视频内容是一个长期追求的目标。尽管现有的视频描述生成方法取得了显著进展,但生成的描述可能并未聚焦于用户特别感兴趣的实体。为解决这一问题,我们提出了一项新的视频描述生成任务:面向主体的视频描述生成(SOVC),旨在允许用户通过边界框指定描述目标。为支持该任务,我们基于两个广泛使用的视频描述生成数据集 MSVD 和 MSRVTT 构建了两个面向主体的视频描述生成数据集,方法是为每个视频中的每条描述标注主体。这些数据集为描述用户感兴趣的目标铺平了道路。为解决该任务,我们引入了一种专门针对该任务定制的名为 SOVCNet 的方法。它由两个关键组件构成:一个面向主体的采样模块,用于采样与主体相关的帧以最大程度减少无关信息;以及一个面向主体的编码模块,该模块将主体区域作为硬提示,并整合可学习的软提示,从而增强模型对主体活动的关注,并促进对下游生成任务的适应。大量实验结果证明了我们的方法在这一新任务上的有效性。

关键词

引用

@article{arxiv.2312.13330,
  title  = {SOVC: Subject-Oriented Video Captioning},
  author = {Chang Teng and Yunchuan Ma and Guorong Li and Yuankai Qi and Laiyu Qing and Qingming Huang},
  journal= {arXiv preprint arXiv:2312.13330},
  year   = {2024}
}