中文

统一静态与动态网络:面向视频定位的高效时序滤波

计算机视觉与模式识别 2025-04-14 v2

摘要

受人类视觉感知生物学中活动静默和持续活动机制的启发,我们设计了一个统一静态与动态网络(UniSDNet),以在跨模态环境中学习视频与文本/音频查询之间的语义关联,从而实现高效的视频定位。对于静态建模,我们设计了一种新颖的残差结构(ResMLP),以增强视频片段与查询之间的全局综合交互,实现更有效的语义增强/补充。对于动态建模,我们在网络设计中有效利用了持续活动机制的三个特性,以更好地理解视频上下文。具体而言,我们基于二维稀疏时序掩码构建了一个扩散连接的视频片段图,以反映“短期效应”关系。我们创新性地将时序距离和相关性作为联合“辅助证据线索”,并设计了一个多核时序高斯滤波器,将上下文线索扩展到高维空间,模拟“复杂视觉感知”,然后在消息传递阶段对相邻片段节点进行元素级滤波卷积操作,最终生成候选提议并进行排序。我们的UniSDNet适用于自然语言视频定位(NLVG)和语音语言视频定位(SLVG)任务。在三个广泛使用的NLVG数据集以及三个SLVG数据集上,我们的UniSDNet均取得了SOTA性能,例如,在ActivityNet Captions上达到了38.88%的R@1,[email protected],在TACoS上达到了40.26%的R@1,[email protected],均创下新纪录。为促进该领域发展,我们为SLVG任务收集了两个新数据集(Charades-STA Speech和TACoS Speech)。同时,我们UniSDNet的推理速度比强大的多查询基准方法快1.56倍。代码可在以下地址获取:https://github.com/xian-sh/UniSDNet。

关键词

引用

@article{arxiv.2403.14174,
  title  = {Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding},
  author = {Jingjing Hu and Dan Guo and Kun Li and Zhan Si and Xun Yang and Xiaojun Chang and Meng Wang},
  journal= {arXiv preprint arXiv:2403.14174},
  year   = {2025}
}

备注

Accepted to IEEE TPAMI 2025