面向密集视听事件定位的局部感知跨模态对应学习
计算机视觉与模式识别
2025-05-12 v4
摘要
密集定位视听事件 (DAVE) 旨在识别长视频中既可听又可见的事件的时间边界及其对应类别,其中事件可能同时发生且持续时间各异。然而,复杂的视听场景通常涉及模态间的异步性,使得精确定位具有挑战性。现有的 DAVE 解决方案通过单模态编码器提取音频和视觉特征,并通过密集的跨模态交互进行融合。然而,在没有跨模态引导的情况下,独立的单模态编码难以强调模态间的共享语义,而密集的跨模态注意力可能会过度关注语义上不相关的视听特征。为了解决这些问题,我们提出了 LoCo,一个面向 DAVE 的局部感知跨模态对应学习框架。LoCo 利用视听事件的局部时间连续性作为重要指导,以过滤不相关的跨模态信号,并在单模态和跨模态编码阶段全程增强跨模态对齐。i) 具体而言,LoCo 应用局部对应特征 (LCF) 调制,通过基于局部跨模态一致性调节音频和视觉特征之间的一致性,强制单模态编码器聚焦于模态共享语义。ii) 为了更好地聚合跨模态相关特征,我们进一步定制了局部自适应跨模态 (LAC) 交互,以数据驱动的方式动态调整注意力区域。这种自适应机制将注意力集中在局部事件边界上,并适应不同的事件持续时间。通过结合 LCF 和 LAC,LoCo 提供了坚实的性能提升,并优于现有的 DAVE 方法。
引用
@article{arxiv.2409.07967,
title = {Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization},
author = {Ling Xing and Hongyu Qu and Rui Yan and Xiangbo Shu and Jinhui Tang},
journal= {arXiv preprint arXiv:2409.07967},
year = {2025}
}