中文

面向关键任务训练与分 debrief 的高效 360 度动作检测与总结框架 ACT360

计算机视觉与模式识别 2025-03-18 v1 多媒体

摘要

在灾害响应、军事模拟和工业安全等高风险、关键任务环境中,精度和最小化错误至关重要。传统的训练后分析依赖手动审查 2D 视频,耗时且缺乏综合的情境意识。为克服这些限制,我们引入 ACT360,一个利用 360 度视频和机器学习进行自动化动作检测和结构化分 debrief 的系统。ACT360 集成 360YOWO,一个增强型 You Only Watch Once (YOWO) 模型,采用空间注意力和等距投影感知卷积 (EAC),以减轻全景视频畸变。为实现资源受限环境的部署,我们应用量化和模型剪枝,将模型大小缩减 74%,同时保持稳健准确率(mAP 从 0.865 下降至 0.850,仅 1.5%),并提升推理速度。我们在包含 55 个标记好的 360 度视频数据集上进行验证,该数据集覆盖七个关键操作动作,记录于各种真实世界训练场合和环境条件下。此外,ACT360 集成 360AIE (Action Insight Explorer),一个基于大语言模型 (LLM) 的网页界面,用于自动动作检测、检索和文本总结,显著提升事后事件分析效率。ACT360 作为一个通用的关键任务分 debrief 框架,融合了 EAC、空间注意力、总结和模型优化。这些创新应用于任何需要轻量级动作检测和结构化训练后分析的训练环境。

关键词

引用

@article{arxiv.2503.12852,
  title  = {ACT360: An Efficient 360-Degree Action Detection and Summarization Framework for Mission-Critical Training and Debriefing},
  author = {Aditi Tiwari and Klara Nahrstedt},
  journal= {arXiv preprint arXiv:2503.12852},
  year   = {2025}
}

备注

9 pages, 8 figures