中文

基于视觉的自然语言场景理解:为自动驾驶提供扩展数据集与新模型

计算机视觉与模式识别 2026-01-22 v1 人工智能 计算与语言 机器学习

摘要

交通场景理解对于使自动驾驶车辆准确感知和解释其环境、确保安全导航至关重要。本文提出了一种新型框架,将单张前视摄像头图像转换为简洁的自然语言描述,有效捕捉空间布局、语义关系和与驾驶相关的线索。该模型利用混合注意力机制来增强空间和语义特征提取,并将这些特征整合以生成语境丰富且详尽的场景描述。为解决该领域专用数据集有限的瓶颈,本文开发了从 BDD100K 数据集派生出的新型数据集,并提供了其构建的全面指导方针。此外,本研究深入讨论了相关评估指标,确定最合适的措施。大量定量评估显示,本文提出的模型在新开发的数据集上表现突出,有效实现了其既定目标。

关键词

引用

@article{arxiv.2601.14438,
  title  = {Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation},
  author = {Danial Sadrian Zadeh and Otman A. Basir and Behzad Moshiri},
  journal= {arXiv preprint arXiv:2601.14438},
  year   = {2026}
}

备注

Under review at Computer Vision and Image Understanding (submitted July 25, 2025)