AVE-CLIP:基于 AudioCLIP 的多窗口时间 Transformer 用于视听事件定位
计算机视觉与模式识别
2022-10-12 v1
摘要
视听事件(AVE)由视频片段中视觉和听觉信号的对应关系表示。AVE 的精确定位极具挑战性,因为它需要有效的多模态特征对应来建立短程和长程时间交互。由于多模态训练策略无效,现有方法难以捕捉不同尺度的多模态交互。为了克服这一局限性,我们引入了 AVE-CLIP,这是一个新颖的框架,它将在大规模视听数据上预训练的 AudioCLIP 与多窗口时间 Transformer 相结合,以在不同时间尺度的视频帧上有效运行。我们的贡献有三个方面:(1)我们引入了一个多阶段训练框架,通过对比微调、有效的平均视频特征提取和多尺度训练阶段,将使用音频-图像对预训练的 AudioCLIP 结合到视频帧上的 AVE 定位任务中。(2)我们提出了一种多域注意力机制,在不同时间尺度的时间域和特征域上运行,以融合局部和全局特征变化。(3)我们引入了一种带有事件引导注意力的时间细化方案,随后是一个简单而有效的后处理步骤,以处理不同事件背景下背景的显著变化。我们的方法在公开可用的 AVE 数据集上取得了 SOTA 性能,平均准确率提升了 5.9%,证明了其相对于现有方法的优越性。
引用
@article{arxiv.2210.05060,
title = {AVE-CLIP: AudioCLIP-based Multi-window Temporal Transformer for Audio Visual Event Localization},
author = {Tanvir Mahmud and Diana Marculescu},
journal= {arXiv preprint arXiv:2210.05060},
year = {2022}
}
备注
Accepted in IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023 (10 Pages, 5 Figures)