面向驾驶员监控系统的跨视图跨模态无监督域适应
计算机视觉与模式识别
2025-11-18 v1 人机交互
摘要
驾驶员分心仍是全球道路交通事故的主要原因, 造成数千人死亡。虽然深度学习基于驾驶员活动识别的方法在检测此类分心方面表现突出, 但其在实际部署中受到两个关键挑战的限制: 相机视角变化(跨视图)和域迁移问题, 例如传感器模态或环境的变化。现有方法通常单独解决跨视图泛化或无监督域适应问题, 留下了在多样化车辆配置中实现稳健和可扩展部署的空白。本文提出一种新颖的两阶段跨视图、跨模态无监督域适应框架, 旨在解决这些挑战, 并应用于实时驾驶员监控数据。在第一个阶段, 我们在单一模态内通过多视图数据的对比学习来学习视角不变且具有行动判别性的特征。在第二个阶段, 我们使用信息瓶颈损失对新模态进行域适应, 无需来自新域的标记数据。我们使用最先进的视频变换器(Video Swin, MViT)和名为 Drive&Act 的多模态驾驶员活动数据集进行评估, 结果表明我们的联合框架在 RGB 视频数据上比基于监督对比学习的跨视图方法提高了近 50% 的顶级准确率, 在相同视频变换器背板下, 比仅进行无监督域适应的方法表现出高达 5% 的优势。
引用
@article{arxiv.2511.12196,
title = {Cross-View Cross-Modal Unsupervised Domain Adaptation for Driver Monitoring System},
author = {Aditi Bhalla and Christian Hellert and Enkelejda Kasneci},
journal= {arXiv preprint arXiv:2511.12196},
year = {2025}
}