3DPyranet 特征融合用于时空特征学习
计算机视觉与模式识别
2025-04-29 v1
摘要
卷积神经网络(CNN)通过在整个图像上滑动内核来产生输出图。这种内核方案相对于全连接神经网络(NN)减少了参数数量。虽然 CNN 在识别手写字符和交通信号标志标识等方面已证明有效,但其深层变体在类似以及更具挑战性的应用中(如物体、场景和动作识别)也显然有效。深层 CNN 添加更多层和内核,以增加参数数量,部分减轻了 CNN 所具有的主要优势,即参数较少。本文提出一种称为 3D 金字塔神经网络的 3DPyraNet 以及基于它的用于时空特征学习的判别方法 3DPyraNet-F。3DPyraNet 引入一种新的加权方案,从空间和时间维度分析多个相邻帧,同时保持生物学上可信的结构。它保持输入图像的空间拓扑结构,参数数量更少,计算和内存成本也低于全连接 NN 和最新的深层 CNN。3DPyraNet-F 提取网络最高层的特征图,通过融合单个向量的方式将其用作输入送入线性 SVM 分类器,以增强从视频中识别人类动作和动态场景的能力。我们在实际环境中报告了 3DPyraNet 的令人鼓舞的结果,尤其是在受相机引起的运动影响的情况下。进一步地,3DPyraNet-F 在三个基准数据集上明显优于当前最先进方法,在第四个数据集上表现相当。
引用
@article{arxiv.2504.18977,
title = {3DPyranet Features Fusion for Spatio-temporal Feature Learning},
author = {Ihsan Ullah and Alfredo Petrosino},
journal= {arXiv preprint arXiv:2504.18977},
year = {2025}
}