中文

在循环协同学习中探索时序事件线索用于密集视频描述

计算机视觉与模式识别 2024-12-17 v1

摘要

密集视频描述旨在检测并描述未剪辑视频中的所有事件。本文提出了一种名为多概念循环学习(MCCL)的密集视频描述网络,其目标是:(1)在帧级别检测多个概念,利用这些概念增强视频特征并提供时序事件线索;(2)在描述网络内的生成器和定位器之间设计循环协同学习,以促进语义感知和事件定位。具体而言,我们对每一帧执行弱监督概念检测,并将检测到的概念嵌入整合到视频特征中以提供事件线索。此外,引入了视频级概念对比学习以获得更具判别性的概念嵌入。在描述网络中,我们建立了一种循环协同学习策略,其中生成器通过语义匹配引导定位器进行事件定位,而定位器通过位置匹配增强生成器的事件语义感知,使语义感知与事件定位相互促进。MCCL 在 ActivityNet Captions 和 YouCook2 数据集上取得了 SOTA 性能。大量实验证明了其有效性和可解释性。

关键词

引用

@article{arxiv.2412.11467,
  title  = {Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning},
  author = {Zhuyang Xie and Yan Yang and Yankai Yu and Jie Wang and Yongquan Jiang and Xiao Wu},
  journal= {arXiv preprint arXiv:2412.11467},
  year   = {2024}
}

备注

Accepted at AAAI 2025