EdgeOAR:面向边缘设备的实时在线动作识别
计算机视觉与模式识别
2024-12-03 v1
摘要
本文针对在线动作识别 (OAR) 这一框架进行工作,该框架涉及对视频流中行为的即时分析与分类。OAR 必须在严格的延迟约束下运行,使其成为边缘计算实时反馈的必不可少的组件。现有方法通常依赖整个视频片段的处理,在需要即时识别的场景中显得不足。为此,我们设计了 EdgeOAR,一个专为在边缘设备上进行 OAR 而设计的新型框架。EdgeOAR 包括面向早期退出的任务特定特征增强模块 (TFEM),该模块由轻量级子模块组成,用于在时空维度上优化特征。我们设计了迭代训练方法,使 TFEM 能够从视频开始处学习特征。此外,EdgeOAR 包括基于逆信息熵 (IIE) 和模态一致性 (MC) 的融合模块,用于融合特征并做出更好的退出决策。这一设计克服了两个主要挑战:在在线视频流中利用有限的初始帧来进行鲁棒的时空动作表示建模,以及在资源受限的边缘设备上平衡准确率与效率。实验表明,在 UCF-101 数据集上,我们的方法 EdgeOAR 相较于最先进 (SOTA) 方法将延迟降低 99.23%,能耗降低 99.28%,并在边缘设备上实现了可接受的准确率。
引用
@article{arxiv.2412.01267,
title = {EdgeOAR: Real-time Online Action Recognition On Edge Devices},
author = {Wei Luo and Deyu Zhang and Ying Tang and Fan Wu and Yaoxue Zhang},
journal= {arXiv preprint arXiv:2412.01267},
year = {2024}
}
备注
12 pages, 10 figures