LIGAR:轻量级通用动作识别
计算机视觉与模式识别
2021-08-31 v1
摘要
视频理解问题中日益增长的不同实际任务数量带来了设计通用解决方案的巨大挑战,该方案应面向广大用户并适用于要求严苛的面向边缘的推理。本文专注于设计网络架构与训练流程以应对上述挑战。我们的架构汲取了先前架构的优点,并带来了不仅在基于外观的动作识别任务中而且在基于运动的任务中均能取得成功的能力。此外,提出了诱导标签噪声问题并给出自适应片段选择(ACS)框架以应对该问题。 together它使LIGAR框架成为通用动作识别解决方案。我们还报告了在通用与手势数据集上的广泛分析,以展示相较于SOTA解决方案在性能与精度之间的优异权衡。训练代码可见于:https://github.com/openvinotoolkit/training_extensions。为高效的面向边缘的推理,所有训练模型均可导出为OpenVINO格式。
引用
@article{arxiv.2108.13153,
title = {LIGAR: Lightweight General-purpose Action Recognition},
author = {Evgeny Izutov},
journal= {arXiv preprint arXiv:2108.13153},
year = {2021}
}