PEDESTRIANQA:面向视觉-语言模型在行人意图与轨迹预测上的基准
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
行人意图和轨迹预测对于自动驾驶系统的安全部署至关重要,直接影响复杂交通环境中的导航决策。近期大型视觉-语言模型的进展为这些任务提供了一种强大的新范式,将高容量视觉理解与灵活的自然语言推理相结合。在本工作中,我们引入 PedestrianQA,一个大规模基于视频的数据集,将行人意图和轨迹预测表述为增强结构化推理的问答任务。PedestrianQA 以自然语言表达丰富标注的行人序列,使视觉语言模型能够从视觉动态、上下文线索以及交通代理间的交互中学习,同时生成其预测的简洁解释,而无需为每个任务定制专门的架构。在 PIE、JAAD、TITAN 和 IDD-PeD 上的实证评估表明,在 PedestrianQA 上微调最先进的视觉语言模型显著提升了意图分类、轨迹预测准确度以及解释性推理的质量,展示了视觉语言模型作为安全关键行人行为建模的统一且可解释框架的强大潜力。
引用
@article{arxiv.2605.24562,
title = {PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction},
author = {Naman Mishra and Shankar Gangisetty and C. V. Jawahar},
journal= {arXiv preprint arXiv:2605.24562},
year = {2026}
}