基于深度模型的无人机捕获视频序列实时人类检测
机器学习
2026-01-06 v1 计算机视觉与模式识别
摘要
视频中的人类检测在各种实际应用中发挥着重要作用。大多数传统方法依赖利用手工特征,这些特征是问题相关的,且针对特定任务最为有效。此外,这些方法高度依赖于动态事件,如光照变化、相机抖动以及对象大小变化。在另一方面,所提出的特征学习方法更为便捷,因为高度抽象和判别性特征可自动生成,而无需专家知识。在本文中,我们利用自动特征学习方法,这些方法结合了光流和三种不同深度模型(即监督卷积神经网络(S-CNN)、预训练CNN特征提取器和层次极端学习机器)用于来自非静态航空平台、具有不同高度的视频捕获的人类检测。该模型在公开且高度具有挑战性的UCF-ARG航空数据集上进行训练和测试。对这些模型在训练、测试准确率和学习速度方面的比较进行了分析。性能评估考虑五种人类动作(挖掘、挥手、投掷、行走和跑步)。实验结果表明,所提出的方法成功地完成了人类检测任务。预训练CNN产生平均准确率为98.09%。S-CNN在softmax和支持向量机(SVM)下的平均准确率分别为95.6%和91.7%。H-ELM的平均准确率为95.9%。在常规中央处理器(CPU)上,H-ELM的训练时间为445秒。S-CNN的学习时间为770秒,需要高性能图形处理器(GPU)。
引用
@article{arxiv.2601.00391,
title = {Real-Time Human Detection for Aerial Captured Video Sequences via Deep Models},
author = {Nouar AlDahoul and Aznul Qalid Md Sabri and Ali Mohammed Mansoor},
journal= {arXiv preprint arXiv:2601.00391},
year = {2026}
}