跨模态一致性与多时间粒度协作下的密集音视频事件定位
计算机视觉与模式识别
2024-12-19 v2
摘要
在音视频学习领域,大多数研究任务仅关注短视频。本文关注更具实用性的密集音视频事件定位(DAVEL)任务,推进针对更长、未剪辑视频的音视频场景理解。该任务旨在识别并时间定位同时在音频和视频流中发生的所有事件。通常,每个视频包含多类密集事件,这些事件可能在时间线上重叠,且各自表现出不同的持续时间。鉴于这些挑战,有效利用音视频关系以及在不同粒度下编码的时间特征变得至关重要。为了应对这些挑战,我们引入了一种新颖的 CCNet,包含两个核心模块:跨模态一致性协作(CMCC)和多时间粒度协作(MTGC)。具体而言,CMCC 模块包含两个分支:跨模态交互分支和时间一致性门控分支。前一个分支通过编码音视频关系促进跨模态一致事件语义的聚合,而后一个分支则引导一种模态的注意力集中在另一种模态中识别出的关键事件相关时间区域。MTGC 模块包括一个粗到细协作块和一个细到粗协作块,在粗粒度和细粒度时间特征之间提供双向支持。在 UnAV-100 数据集上的大量实验验证了我们的模块设计,在密集音视频事件定位中取得了新的 SOTA 性能。代码可在 https://github.com/zzhhfut/CCNet-AAAI2025 获取。
引用
@article{arxiv.2412.12628,
title = {Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration},
author = {Ziheng Zhou and Jinxing Zhou and Wei Qian and Shengeng Tang and Xiaojun Chang and Dan Guo},
journal= {arXiv preprint arXiv:2412.12628},
year = {2024}
}
备注
Accepted by AAAI 2025. Project page: https://github.com/zzhhfut/CCNet-AAAI2025. Jinxing Zhou and Dan Guo are the corresponding authors