通过PSO-ConvNet Transformer利用动力学进行视频动作识别的协作学习
计算机视觉与模式识别
2023-09-22 v3
摘要
识别视频序列中的人类动作,即人类动作识别(HAR),是模式识别中的一项挑战性任务。虽然卷积神经网络(ConvNets)在图像识别中取得了显著成功,但它们并不总是直接适用于HAR,因为时间特征对于准确分类至关重要。在本文中,基于我们近期在图像识别方面的工作,我们提出了一种新颖的动态PSO-ConvNet模型,用于学习视频中的动作。我们的方法利用了一个框架,其中每个神经网络的权重向量代表相空间中粒子的位置,粒子共享其当前的权重向量和损失函数的梯度估计。为将我们的方法扩展到视频,我们将ConvNets与最先进的时间方法(如Transformer和循环神经网络)集成。我们在UCF-101数据集上的实验结果表明,准确率显著提高了高达9%,证实了我们提出方法的有效性。此外,我们在更大且更多样化的数据集(包括Kinetics-400和HMDB-51)上进行了实验,并获得了协作学习相对于非协作学习(个体学习)的偏好。总体而言,我们的动态PSO-ConvNet模型通过更好地捕捉视频中人类动作的时空动力学,为改进HAR提供了一个有前景的方向。代码可在https://github.com/leonlha/Video-Action-Recognition-Collaborative-Learning-with-Dynamics-via-PSO-ConvNet-Transformer获取。
引用
@article{arxiv.2302.09187,
title = {Video Action Recognition Collaborative Learning with Dynamics via PSO-ConvNet Transformer},
author = {Nguyen Huu Phong and Bernardete Ribeiro},
journal= {arXiv preprint arXiv:2302.09187},
year = {2023}
}
备注
18 pages