基于 CNN 的动作识别与姿态估计用于从视频中分类动物行为:综述
计算机视觉与模式识别
2023-01-18 v1 人工智能
机器学习
摘要
从视频中分类人类或动物的行为在生物医学领域对于理解大脑功能和对刺激的响应具有重要意义。动作识别,即在裁剪后的视频中对一个或多个主体执行的活动进行分类,构成了许多此类技术的基础。在过去十年中,用于人类动作识别的深度学习模型取得了显著进展。最近,将基于深度学习的动作识别用于动物行为分类的研究兴趣日益增加。然而,人类动作识别方法更为成熟。本综述概述了基于卷积神经网络(CNN)架构的人类动作识别和姿态估计方法,这些方法已被改编用于神经科学中的动物行为分类。姿态估计,即从图像帧中估计关节位置,被包含在内是因为它通常在分类动物行为之前应用。首先,我们提供了通过 2D、双流和 3D CNN 学习时空特征的算法的基础信息。我们探讨了决定优化器、损失函数和训练过程的激励因素,并比较了它们在基准数据集上的性能。接下来,我们回顾了使用或基于这些方法构建的动物行为框架,并按其所需的监督程度进行组织。我们的讨论独特地聚焦于底层 CNN 模型的技术演进及其架构改编(我们对此进行了说明),而非它们在神经科学实验室中的可用性。我们最后讨论了开放的研究问题和可能的研究方向。我们的综述旨在为开发完全无监督的动物行为分类系统的研究人员提供资源,此类系统在文献中仅有少数实例。
引用
@article{arxiv.2301.06187,
title = {CNN-Based Action Recognition and Pose Estimation for Classifying Animal Behavior from Videos: A Survey},
author = {Michael Perez and Corey Toler-Franklin},
journal= {arXiv preprint arXiv:2301.06187},
year = {2023}
}
备注
29 pages, 20 figures