用于航拍视频动作识别的基于频率的可微分解耦
计算机视觉与模式识别
2025-02-13 v2
摘要
我们提出了一种用于视频中人体活动识别的学习算法。我们的方法专为无人机(UAV)视频设计,此类视频主要由倾斜放置的动态相机采集,其中包含人体执行者以及背景运动。通常,人体执行者占据的空间分辨率不到十分之一。我们的方法同时利用了频域表示(信号处理中的经典分析工具)与数据驱动的神经网络的优势。我们构建了一个可微分的静态-动态频率掩码先验,以建模视频中对动作识别这一底层任务至关重要的显著静态与动态像素。我们利用该可微分掩码先验使神经网络通过恒等损失函数内在地学习解耦的特征表示。我们的公式赋予网络在其各层内固有地计算解耦显著特征的能力。此外,我们提出了一种封装时间相关性与空间内容的代价函数,以在均匀间隔的视频段中采样最重要的帧。我们在UAV Human数据集与NEC Drone数据集上进行了大量实验,结果表明相较最先进水平相对提升5.72%–13.00%,相较相应基线模型相对提升14.28%–38.05%。
引用
@article{arxiv.2209.09194,
title = {Differentiable Frequency-based Disentanglement for Aerial Video Action Recognition},
author = {Divya Kothandaraman and Ming Lin and Dinesh Manocha},
journal= {arXiv preprint arXiv:2209.09194},
year = {2025}
}