基于基础模型的低成本实时工业动作识别框架
计算机视觉与模式识别
2025-09-01 v2
摘要
工业环境中的动作识别(AR)——特别是识别动作和操作手势——因部署成本高、跨场景泛化能力差以及实时性能有限而面临持续挑战。为解决这些问题,我们提出了一种基于基础模型的低成本实时工业动作识别框架,称为 LRIAR,旨在提高识别准确率和可迁移性,同时最大限度地减少人工标注和计算开销。该框架通过将 Grounding DINO 与预训练的 BLIP-2 图像编码器耦合,构建自动标注数据集,实现高效且可扩展的动作标注。利用构建的数据集,我们训练 YOLOv5 进行实时动作检测,并通过基于 LoRA 的微调开发了 Vision Transformer (ViT) 分类器用于动作分类。在真实工业环境中进行的大量实验验证了 LRIAR 的有效性,证明其在识别准确率、场景泛化和部署效率方面相较于现有最优方法均有持续提升。
引用
@article{arxiv.2403.08420,
title = {ALow-Cost Real-Time Framework for Industrial Action Recognition Using Foundation Models},
author = {Zhicheng Wang and Wensheng Liang and Ruiyan Zhuang and Shuai Li and Jianwei Tan and Xiaoguang Ma},
journal= {arXiv preprint arXiv:2403.08420},
year = {2025}
}