面向可解释自动驾驶的多模态框架:集成视频、传感器与文本数据以提升决策与透明性
多媒体
2025-07-11 v1
摘要
自动驾驶车辆(AVs)正被预测将通过提升道路安全性、最小化人为错误和优化交通效率来重新定义交通方式。AVs的成功取决于其能够通过包括视频流、传感器测量和上下文文本信息等多种数据源来解释复杂、动态的环境。然而,无缝集成这些多模态输入并确保AI驱动决策的透明性仍是巨大的挑战。本研究引入一种新型的多模态框架,通过协同融合视频、传感器和文本数据来预测驾驶行为,同时生成人类可读的解释,以培育信任并满足监管合规。通过采用VideoMAE进行时空视频分析、自定义传感器融合模块进行实时数据处理以及BERT进行文本理解,我们的方法实现了稳健的决策制定和可解释输出。在BDD-X(21113个样本)和nuScenes(1000个场景)数据集上进行评估后,我们的模型在五个epoch内将训练损失从5.7231降至0.0187,实现了92.5%的行动预测准确率和0.75的BLEU-4分数,优于当前流方法。消融研究确认了各模态的关键作用,而定性分析和人类评估则凸显了模型能够产生富有情境性且用户友好的解释。这些突破性进展凸显了多模态集成和可解释性在构建安全、透明且可信赖的AV系统中的变革性潜力,为更广泛的社会接受自动驾驶技术铺平了道路。
引用
@article{arxiv.2507.07938,
title = {Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency},
author = {Abolfazl Zarghani and Amirhossein Ebrahimi and Amir Malekesfandiari},
journal= {arXiv preprint arXiv:2507.07938},
year = {2025}
}