中文

基于双重解耦的视觉语言模型零样本分心驾驶检测

计算机视觉与模式识别 2026-01-14 v1 机器学习 图像与视频处理

摘要

分心驾驶是引发交通事故的主要原因,亟需鲁棒且可扩展的检测方法。视觉语言模型 (VLM) 具备强大的零样本图像分类能力,但现有的基于 VLM 的分心驾驶检测器在真实世界条件下往往表现不佳。我们将特定主体的外观变化(如衣着、年龄和性别)确定为关键瓶颈:VLM 将这些因素与行为线索相纠缠,导致其决策受限于“驾驶员是谁”而非“驾驶员在做什么”。为解决此问题,我们提出一种主体解耦框架,该框架提取驾驶员外观嵌入并在零样本分类前从图像嵌入中消除其影响,从而强调与分心相关的证据。我们进一步通过将文本嵌入度量投影到 Stiefel 流形上对其进行正交化,以在保持接近原始语义的同时提升可分离性。实验表明,相较于先前基线取得了一致的提升,表明我们的方法在实际道路安全应用中具有前景。

关键词

引用

@article{arxiv.2601.08467,
  title  = {Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling},
  author = {Takamichi Miyata and Sumiko Miyata and Andrew Morris},
  journal= {arXiv preprint arXiv:2601.08467},
  year   = {2026}
}