面向通用事件边界检测的局部压缩视频流学习
计算机视觉与模式识别
2023-09-28 v1 人工智能
摘要
通用事件边界检测旨在定位将视频分割为片段的通用、无分类体系的事件边界。现有方法通常需要在将视频帧送入网络之前进行解码,这包含显著的时空冗余,并需要可观的计算能力与存储空间。为弥补这些问题,我们提出一种新颖的用于事件边界检测的压缩视频表示学习方法,该方法完全端到端,利用压缩域中的丰富信息(即 RGB、运动向量、残差以及图像组(GOP)内部结构),而无需完全解码视频。具体而言,我们使用轻量级 ConvNets 提取 GOP 中 P 帧的特征,并设计空间-通道注意力模块(SCAM),基于具有双向信息流的压缩信息来精炼 P 帧的特征表示。为学习适用于边界检测的表示,我们为每个候选帧构建局部帧袋,并使用长短期记忆(LSTM)模块捕获时间关系。随后我们在时域中计算帧间差异与组相似性。该模块仅应用于局部窗口内,这对事件边界检测至关重要。最后使用一个简单分类器基于学习到的特征表示确定视频序列的事件边界。为弥补标注的模糊性并加速训练过程,我们使用高斯核对真值事件边界进行预处理。在 Kinetics-GEBD 和 TAPOS 数据集上进行的广泛实验表明,所提方法在与先前端到端方法运行速度相同的情况下取得了显著改进。代码见 https://github.com/GX77/LCVSL。
引用
@article{arxiv.2309.15431,
title = {Local Compressed Video Stream Learning for Generic Event Boundary Detection},
author = {Libo Zhang and Xin Gu and Congcong Li and Tiejian Luo and Heng Fan},
journal= {arXiv preprint arXiv:2309.15431},
year = {2023}
}
备注
Accepted by IJCV. arXiv admin note: substantial text overlap with arXiv:2203.15336