SpikeMba:面向时序视频定位的多模态脉冲显著性曼巴模型
计算机视觉与模式识别
2024-05-24 v2 多媒体
摘要
时序视频定位(TVG)是视频内容理解中的一项关键任务,要求视频内容与自然语言指令之间实现精确对齐。尽管取得了显著进展,现有方法在管理对显著对象的置信度偏差以及捕获视频序列中的长期依赖关系方面仍面临挑战。为解决这些问题,我们提出了SpikeMba:一种用于时序视频定位的多模态脉冲显著性曼巴模型。我们的方法将脉冲神经网络(SNNs)与状态空间模型(SSMs)相结合,以利用它们在处理任务不同方面的独特优势。具体而言,我们使用SNNs开发了一个脉冲显著性检测器来生成候选提议集。当输入信号超过预定义阈值时,该检测器会发出脉冲信号,从而产生一个动态且二值的显著性候选提议集。为了增强模型保留和推断上下文信息的能力,我们引入了相关槽位,即可编码先验知识的可学习张量。这些槽位与上下文时刻推理器协同工作,以在保留上下文信息和动态探索语义相关性之间保持平衡。SSMs促进了选择性信息传播,解决了视频内容中的长期依赖问题。通过结合用于候选提议生成的SNNs和用于有效上下文推理的SSMs,SpikeMba解决了置信度偏置和长期依赖问题,从而显著增强了对细粒度多模态关系的捕获。我们的实验证明了SpikeMba的有效性,其在主流基准测试中始终优于最先进的方法。
引用
@article{arxiv.2404.01174,
title = {SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding},
author = {Wenrui Li and Xiaopeng Hong and Ruiqin Xiong and Xiaopeng Fan},
journal= {arXiv preprint arXiv:2404.01174},
year = {2024}
}