中文

利用 3D 视频分类对林业机械作业的时空分析

计算机视觉与模式识别 2025-06-02 v1

摘要

本文提出了一种基于深度学习的框架,用于对行车记录仪视频片段中的林业作业进行分类。聚焦于四个关键作业要素——吊臂伸出、伐木至加工、行驶和加工——该方法采用了基于 PyTorchVideo 实现的 3D ResNet-50 架构。该模型在人工标注的现场录制数据集上进行训练,取得了优异的性能,验证集 F1 分数为 0.88,精确率为 0.90。这些结果突显了时空卷积网络在捕捉真实林业环境中运动模式和外观特征方面的有效性。该系统集成了标准的预处理和数据增强技术以提高泛化能力,但过拟合现象依然明显,凸显了对更多训练数据和更好类别平衡的需求。尽管存在这些挑战,该方法在减少传统时间研究相关的手动工作量方面展示了清晰的潜力,为林业中的作业监测和效率分析提供了可扩展的解决方案。这项工作有助于人工智能在自然资源管理中日益增长的应用,并为未来能够在林业机械中实现实时活动识别的系统奠定了基础。计划的改进措施包括数据集扩展、增强正则化以及在嵌入式系统上进行实地使用的部署试验。

关键词

引用

@article{arxiv.2505.24375,
  title  = {Spatiotemporal Analysis of Forest Machine Operations Using 3D Video Classification},
  author = {Maciej Wielgosz and Simon Berg and Heikki Korpunen and Stephan Hoffmann},
  journal= {arXiv preprint arXiv:2505.24375},
  year   = {2025}
}