面向视频-based 司机动作与意图识别的潜在不确定性表示
计算机视觉与模式识别
2025-10-07 v1 机器学习
摘要
深度神经网络 (DNN) 越来越多地应用于资源受限环境中的安全关键任务,如视频-based 司机动作和意图识别。虽然最后一层概率深度学习 (LL-PDL) 方法可以检测离群分布 (OOD) 实例,但其性能有所不同。作为最后一层方法的替代方案,我们提出扩展预训练 DNN 以产生多个潜在表示来估计不确定性。我们对比评估了我们的潜在不确定性表示 (LUR) 和 repulsion 训练的 LUR (RLUR) 方法,针对八种 PDL 方法以及四个视频-based 司机动作和意图识别数据集,比较分类性能、校准和不确定性-based OOD 检测。我们也为 NuScenes 数据集贡献了 28,000 帧级动作标签和 1,194 个视频级意图标签。我们的结果表明,LUR 和 RLUR 在分类性能上与其他 LL-PDL 方法相当。对于不确定性-based OOD 检测,LUR 在匹配顶尖 PDL 方法的同时,比需要马尔可夫链蒙特卡洛抽样或 repulsion 训练程序的做法更高效且更易调参。
引用
@article{arxiv.2510.05006,
title = {Latent Uncertainty Representations for Video-based Driver Action and Intention Recognition},
author = {Koen Vellenga and H. Joe Steinhauer and Jonas Andersson and Anders Sjögren},
journal= {arXiv preprint arXiv:2510.05006},
year = {2025}
}
备注
16 pages, 8 figures, 7 tables, under submission