EraW-Net:用于场景关联驾驶员注意力估计的增强-细化-对齐W-Net
计算机视觉与模式识别
2024-11-01 v2
摘要
将驾驶员注意力与两个视场(FOV)下的驾驶场景相关联是一个困难的跨域感知问题,需要综合考虑跨视图映射、动态驾驶场景分析和驾驶员状态跟踪。以往方法通常关注单一视图或通过估计的注视点将注意力映射到场景,未能利用两者之间的隐含联系。此外,简单的融合模块不足以建模两个视图之间的复杂关系,使得信息整合具有挑战性。为解决这些问题,我们提出了一种用于端到端场景关联驾驶员注意力估计的新方法,称为EraW-Net。该方法通过W形架构(称为W-Net)增强最具判别性的动态线索,细化特征表示,并促进语义对齐的跨域集成。具体而言,我们提出了动态自适应滤波模块(DAF-Module)以应对频繁变化的驾驶环境带来的挑战,通过提取关键区域。该模块通过创新的联合频率-空间分析抑制无差别记录的动态信息并突出关键信息,增强模型解析复杂动态的能力。此外,为跟踪非固定面部姿态下的驾驶员状态,我们提出了全局上下文共享模块(GCS-Module),通过捕获适应不同头部和眼部运动尺度的层次化特征来构建细化的特征表示。最后,W-Net通过其“编码-独立解码-融合解码”的结构实现系统的跨视图信息集成,解决了异构数据集成中的语义错位问题。实验表明,所提方法在大型公开数据集上能够稳健且准确地估计驾驶员在场景中的注意力映射。
关键词
引用
@article{arxiv.2408.08570,
title = {EraW-Net: Enhance-Refine-Align W-Net for Scene-Associated Driver Attention Estimation},
author = {Jun Zhou and Chunsheng Liu and Faliang Chang and Wenqian Wang and Penghui Hao and Yiming Huang and Zhiqiang Yang},
journal= {arXiv preprint arXiv:2408.08570},
year = {2024}
}
备注
13pages, 9 figures