迈向开放词汇音视频事件定位
计算机视觉与模式识别
2025-03-12 v3 多媒体
摘要
音视频事件定位(AVEL)任务旨在从时间上定位并分类那些既可听又可见的视频事件。该领域的大多数研究假设一个闭集设定,这限制了这些模型处理包含训练期间未出现(未见)的事件类别的测试数据的能力。最近,一些研究探索了开放集设定下的AVEL,使得能够将未见事件识别为“未知”,但不提供类别特定的语义。在本文中,我们通过引入开放词汇音视频事件定位(OV-AVEL)问题来推动该领域的发展,该问题要求在推理时定位音视频事件并为已见和未见数据预测明确的类别。为了解决这个新任务,我们提出了OV-AVEBench数据集,该数据集包含24,800个视频,涵盖67个真实生活音视频场景(已见:未见 = 46:21),每个视频都有手动的片段级标注。我们还为此任务建立了三个评估指标。此外,我们研究了两种基线方法,一种无需训练,另一种使用进一步微调的范式。具体来说,我们利用预训练ImageBind模型中的统一多模态空间来提取音频、视觉和文本(事件类别)特征。无需训练的基线然后通过比较音频-文本和视觉-文本特征相似度的一致性来确定预测。微调基线则结合了轻量级时序层来编码音频和视觉模态内的时序关系,并使用OV-AVEL训练数据进行模型微调。我们在提出的OV-AVEL数据集上评估了这些基线,并讨论了这个新领域未来工作的潜在方向。
引用
@article{arxiv.2411.11278,
title = {Towards Open-Vocabulary Audio-Visual Event Localization},
author = {Jinxing Zhou and Dan Guo and Ruohao Guo and Yuxin Mao and Jingjing Hu and Yiran Zhong and Xiaojun Chang and Meng Wang},
journal= {arXiv preprint arXiv:2411.11278},
year = {2025}
}
备注
accepted by CVPR 2025; Project page: https://github.com/jasongief/OV-AVEL