中文

在未裁剪视频中密集定位音视事件:大规模基准与基线

计算机视觉与模式识别 2023-03-27 v2 多媒体 声音 音频与语音处理

摘要

现有的音视事件定位(AVE)处理人工裁剪的视频,且每帧仅含单个实例。然而,该设定不切实际,因为自然视频常包含众多不同类别的音视事件。为更好适应真实应用,本文关注密集定位音视事件任务,旨在联合定位并识别未裁剪视频中出现的所有音视事件。该问题具有挑战性,因其需要细粒度的音视场景与上下文理解。为应对此问题,我们引入了首个未裁剪音视(UnAV-100)数据集,包含 10K 个未裁剪视频及超过 30K 个音视事件。每个视频平均有 2.8 个音视事件,且事件通常相互关联并可能如真实场景般共现。接下来,我们使用一个新的基于学习的框架来形式化该任务,该框架能够充分融合音频与视觉模态,以单次前向过程定位不同长度的音视事件并捕获其依赖关系。大量实验证明了我们方法的有效性,以及多尺度跨模态感知与依赖建模对该任务的重要意义。

关键词

引用

@article{arxiv.2303.12930,
  title  = {Dense-Localizing Audio-Visual Events in Untrimmed Videos: A Large-Scale Benchmark and Baseline},
  author = {Tiantian Geng and Teng Wang and Jinming Duan and Runmin Cong and Feng Zheng},
  journal= {arXiv preprint arXiv:2303.12930},
  year   = {2023}
}

备注

Accepted by CVPR2023