RoadSceneBench:用于中级道路场景理解的轻量级基准
计算机视觉与模式识别
2025-12-01 v1
摘要
理解中级道路语义对于可靠的自动驾驶和数字地图构建至关重要,因为它捕捉了连接低层感知与高层规划的结构和上下文线索。然而,现有基准主要针对检测或分割等感知任务,忽略了推理能力以推断道路拓扑和动态场景结构所必需的能力。为此,我们提出RoadSceneBench,一个轻量级且信息丰富的基准,旨在评估和推进复杂道路环境中的视觉推理。与大规模感知数据集不同,RoadSceneBench强调关系理解和结构一致性,鼓励模型捕捉真实世界道路场景中的底层逻辑。此外,为增强推理可靠性,我们提出了层次化关系奖励传播与时间一致性(Hierarchical Relational Reward Propagation with Temporal Consistency, HRRP-T),这是一种用于视觉语言模型(Vision-Language Models, VLMs)的训练框架,其中奖励信号会在推理过程中适应性地促进空间一致性和语义对齐。这种范式使模型能够超越静态识别,走向几何感知和时序一致的推理。大量实验表明,我们的方法在多样化的道路配置下实现了最先进的性能。因此,RoadSceneBench为研究中级道路语义并促进结构感知的自动驾驶提供了一个紧凑而有力的基础。我们的数据集已公开于 https://github.com/XiyanLiu/RoadSceneBench。
引用
@article{arxiv.2511.22466,
title = {RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding},
author = {Xiyan Liu and Han Wang and Yuhu Wang and Junjie Cai and Zhe Cao and Jianzhong Yang and Zhen Lu},
journal= {arXiv preprint arXiv:2511.22466},
year = {2025}
}