CLASP:基于跨模态显著锚点的弱监督密集音视频事件局部化
计算机视觉与模式识别
2025-08-07 v1 人工智能
多媒体
摘要
密集音视频事件局部化(DAVEL)任务旨在对无剪辑视频中同时发生于音频和视觉模态的事件进行时间局部化。本文在更具挑战性的弱监督设置下(W-DAVEL)探讨 DAVEL 问题,仅提供视频级事件标签,事件的时间边界未知。我们通过利用跨模态显著锚点(cross-modal salient anchors)来解决 W-DAVEL,这些锚点在弱监督下被可靠预测,并在音频和视觉模态之间展现高度一致的事件语义。具体而言,我们提出了“互动事件一致性评估”(Mutual Event Agreement Evaluation)模块,通过度量预测的音频和视觉事件类别之间的差异生成一致性得分。随后,利用该一致性得分,“跨模态显著锚点识别”(Cross-modal Salient Anchor Identification)模块通过全局视频和局部时间窗口识别机制识别音频和视觉锚点特征。将多模态集成后的锚点特征输入到“基于锚点的时序传播”(Anchor-based Temporal Propagation)模块,以增强对原始时序音视频特征中事件语义的编码,实现在弱监督条件下的更佳时间局部化。我们在 UnAV-100 和 ActivityNet1.3 数据集上建立了 W-DAVEL 的基准。大量实验表明,我们的方法在性能上实现了最新水平。
引用
@article{arxiv.2508.04566,
title = {CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization},
author = {Jinxing Zhou and Ziheng Zhou and Yanghao Zhou and Yuxin Mao and Zhangling Duan and Dan Guo},
journal= {arXiv preprint arXiv:2508.04566},
year = {2025}
}