中文

DIBS:通过伪边界增强与在线精炼利用无标签视频增强密集视频描述

计算机视觉与模式识别 2024-04-04 v1 人工智能 多媒体

摘要

我们提出了 Dive Into the BoundarieS (DIBS),一种用于密集视频描述(DVC)的新型预训练框架,该框架致力于从无标签视频中提升生成的事件描述及其相关伪事件边界的质量。通过利用多样化大型语言模型(LLMs)的能力,我们生成了丰富的面向 DVC 的描述候选,并在几个精心设计的目标下优化相应的伪边界,这些目标考虑了多样性、以事件为中心、时间顺序和连贯性。此外,我们进一步引入了一种新颖的在线边界精炼策略,在训练过程中迭代地提升伪边界的质量。我们进行了全面的实验以检验所提出技术组件的有效性。通过利用大量无标签视频数据(如 HowTo100M),我们在 YouCook2 和 ActivityNet 等标准 DVC 数据集上取得了显著进展。我们在大多数指标上超越了之前的最先进方法 Vid2Seq,而仅使用了 Vid2Seq 用于预训练的无标签视频数据的 0.4%。

关键词

引用

@article{arxiv.2404.02755,
  title  = {DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement},
  author = {Hao Wu and Huabin Liu and Yu Qiao and Xiao Sun},
  journal= {arXiv preprint arXiv:2404.02755},
  year   = {2024}
}

备注

Accepted by CVPR 2024