中文

基于驾驶员状态世界建模的风险感知选择性多模态驾驶员监控

机器人学 2026-06-25 v1 人工智能

摘要

自动驾驶车辆中的持续驾驶员监控需要低延迟推理,同时避免在不确定驾驶员状态下做出不安全决策。大型视觉语言模型提供了宽泛的多模态先验,但其延迟及在该场景下的有限可靠性使其不适合作为常驻车内监控器。我们提出一种面向可部署多模态驾驶员监控的成本感知选择性推理框架。核心系统是一个轻量 RGB-生理学生成模型,将车内视觉观测与窗口级 HR/EDA 信号结合,并包含一个学习门控,决定何时接受快速预测或弃权以进行安全干预。附加控制表明,学习得分包含超出场景先验的样本级信息,而精确的生理同步仍是一个局限。为纳入预测证据,我们进一步研究一个紧凑的驾驶员状态世界建模模块,其展开潜变量驾驶员状态特征并估计未来快速模型误差与反事实系统级动作成本。在场景诱发的驾驶员需求识别上,RGB-生理学生成模型优于仅 RGB 与仅生理学基线,以 11.39M 参数与 3.08ms 推理延迟达到 0.7440 Macro-F1 与 0.9099 平衡准确率。成本感知选择性推理将不安全假阴性从常速推理下的 17.37% 降至跨种子约 5%,同时保持部署级延迟。尽管驾驶员状态世界建模提供了有价值的预测信号,最差组评估凸显了持续的工作点校准漂移。归根结底,可靠的边缘驾驶员监控不仅需要推进感知主干,还需风险感知选择性控制与组鲁棒校准。

关键词

引用

@article{arxiv.2606.26922,
  title  = {Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling},
  author = {Daosheng Qiu and Haozhuang Chi and Hao Su and Shu Long and Xinyue Miao and Yongle Dong and Wei Zhang},
  journal= {arXiv preprint arXiv:2606.26922},
  year   = {2026}
}