基于 Transformer 的 2D 姿态与时空嵌入融合用于分心驾驶行为识别
计算机视觉与模式识别
2024-03-12 v1
摘要
随时间对驾驶行为进行分类和定位对于高级驾驶辅助系统和自然驾驶研究至关重要。时间定位具有挑战性,因为它需要鲁棒性、可靠性和准确性。在本研究中,我们旨在通过将视频动作识别和 2D 人体姿态估计网络适配到一个模型中,来提高时间定位和分类的准确性性能。因此,我们设计了一种基于 Transformer 的融合架构,以有效结合 2D 姿态特征和时空特征。该模型使用 2D 姿态特征作为 Transformer 架构的位置嵌入,并使用时空特征作为 Transformer 编码器的主要输入。所提出的解决方案是通用的,独立于摄像头数量和位置,输出基于帧的类别概率。最后,后处理步骤结合来自不同摄像头视角的信息以获得最终预测并消除误报。该模型在 2023 年 NVIDIA AI City Challenge 自然驾驶行为识别的 A2 测试集上表现良好,实现了组织者定义的分心驾驶行为指标的重叠得分为 0.5079。
引用
@article{arxiv.2403.06577,
title = {Transformer-based Fusion of 2D-pose and Spatio-temporal Embeddings for Distracted Driver Action Recognition},
author = {Erkut Akdag and Zeqi Zhu and Egor Bondarev and Peter H. N. De With},
journal= {arXiv preprint arXiv:2403.06577},
year = {2024}
}