中文

适应未知数: 基于动态阈值的无训练音视频事件感知

计算机视觉与模式识别 2025-03-24 v2

摘要

在音视频事件感知领域,该领域专注于跨模态(音频和视频)事件的时间局部化和分类,现有方法受限于其训练数据中可用词汇表,这显著阻碍了其对新颖、未见事件类别的泛化能力。此外,该任务的标注过程代价高昂,需要跨模态和时间段进行大量手动标注,限制了当前方法的可扩展性。当前的最先进模型忽略了随时间变化的事件分布偏移,降低了其调整视频动态变化的能力。此外,之前的方法依赖于后期融合来组合音频和视频信息。虽然这种方法直观,但会导致多模态相互作用的显著损失。为解决这些挑战,我们提出了 Audio-Visual Adaptive Video Analysis (AV²A),这是一种无需进一步训练的模型无关方法,集成了得分级别融合技术以保留更丰富的多模态相互作用。AV²A 还包括一种视频内部标签偏移算法,利用输入视频数据和来自前帧的预测,动态调整后续帧的事件分布。此外,我们present首个无训练音视频事件感知的开放词汇基线,表明 AV²A 在对抗无训练基线方面取得显著改进。我们在零样本和弱监督的最先进方法上 demonstrate了 AV²A 的有效性,在现有方法上实现显著的性能提升。

关键词

引用

@article{arxiv.2503.13693,
  title  = {Adapting to the Unknown: Training-Free Audio-Visual Event Perception with Dynamic Thresholds},
  author = {Eitan Shaar and Ariel Shaulov and Gal Chechik and Lior Wolf},
  journal= {arXiv preprint arXiv:2503.13693},
  year   = {2025}
}