道路之眼,意识超越视野:面向风险预警的上下文感知多模态增强方法
计算工程、金融与科学
2025-07-17 v2
摘要
准确预测事故仍然具有挑战性,因为驾驶员的认知和动态路况在预测模型中未得到充分代表。本文提出CAMERA(Context-Aware Multi-modal Enhanced Risk Anticipation),一种多模态框架,集成dashcam视频、文本注释和驾驶员注意力图,以实现可靠的事故预警。不同于依赖静态或环境中心阈值的现有方法,CAMERA采用由场景复杂度和注视熵启发的自适应机制,减少误报,同时在动态、多主体交通情境中保持高召回率。层次化融合管道采用Bi-GRU(Bidirectional GRU)捕获时空依赖关系,Geo-Context Vision-Language模块将3D空间关系转化为可解释的人类中心警报。在DADA-2000和基准数据集上的评估表明,CAMERA实现了最先进的性能,提升了准确率和预警时间。这些结果表明,建模驾驶员注意力、上下文描述和自适应风险阈值对于实现更可靠的事故预警具有重要作用。
引用
@article{arxiv.2507.06444,
title = {Eyes on the Road, Mind Beyond Vision: Context-Aware Multi-modal Enhanced Risk Anticipation},
author = {Jiaxun Zhang and Haicheng Liao and Yumu Xie and Chengyue Wang and Yanchen Guan and Bin Rao and Zhenning Li},
journal= {arXiv preprint arXiv:2507.06444},
year = {2025}
}
备注
Accepted by ACMMM2025