RailVQA: 自动列车运行中高效可解释视觉认知的基准与框架
计算机视觉与模式识别
2026-04-24 v2
摘要
随着自动列车运行 (ATO) 向 GoA4 及以上等级发展,它日益依赖于高效、可靠的司机室视角视觉感知和面向决策的推理,以确保在复杂且动态的铁路环境中的安全运行。然而,现有方法主要关注基本感知,且往往泛化到罕见但安全关键的边缘情况时表现不佳。它们还缺乏运营决策所需的高层推理和规划能力。尽管近期的大型多模态模型 (LMM) 展现出强大的泛化和认知能力,但其在安全关键 ATO 中的应用受到高计算成本和幻觉风险的阻碍。同时,可靠的领域特定基准用于系统评估认知能力仍然缺乏。为解决这些空白,我们引入 RailVQA-bench——首个面向 ATO 中司机室视角视觉认知的 VQA 基准,包含 20,000 个单帧和 1,168 个基于视频的问答对,用于评估静态和动态场景中的认知泛化性和可解释性。此外,我们提出 RailVQA-CoM,一个协作大-小模型框架,通过透明的三模块架构和自适应时间采样,将小模型效率与大模型认知相结合,改善感知泛化并实现更高效的推理和规划。实验表明,所提出的方法显著提升了性能,增强了可解释性,提高了效率,并加强了自动驾驶系统中的跨域泛化能力。代码和数据集将在 https://cybereye-bjtu.github.io/RailVQA.html 上公开。
引用
@article{arxiv.2603.27112,
title = {RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation},
author = {Sen Zhang and Runmei Li and Shizhuang Deng and Zhichao Zheng and Yuhe Zhang and Jiani Li and Kailun Zhang and Tao Zhang and Wenjun Wu and Qunbo Wang},
journal= {arXiv preprint arXiv:2603.27112},
year = {2026}
}