具备LLM引导步行性的场景约束行人轨迹预测框架
计算机视觉与模式识别
2025-06-18 v1 人工智能
摘要
准确预测行人轨迹对机器人和监控系统的应用至关重要。虽然现有方法主要关注行人之间的社交互动,但常常忽视了显著塑造人类运动模式的丰富环境背景。本文提出SceneAware,一个显式融合场景理解以提升轨迹预测准确性的新框架。我们利用Vision Transformer(ViT)场景编码器处理来自静态场景图像的环境背景,而多模态大型语言模型(MLLMs)生成二值步行性掩码,在训练期间区分可访问区域和受限区域。我们将基于Transformer的轨迹编码器与ViT-based 场景编码器结合,既捕捉时序动力学,又捕捉空间约束。框架集成碰撞惩罚机制,以防止预测轨迹违反物理边界,确保物理上可信的预测。SceneAware实现为确定性和随机两个变体。针对ETH/UCY基准数据集进行全面实验,表明该方法在准确率和可靠性方面均优于最先进的方法,且在各种行人运动类型下表现一致。我们的分析表明,使用显式场景信息的重要性,以及我们基于场景的方法既有效又可靠。代码可在 https://github.com/juho127/SceneAware 获取。
引用
@article{arxiv.2506.14144,
title = {SceneAware: Scene-Constrained Pedestrian Trajectory Prediction with LLM-Guided Walkability},
author = {Juho Bai and Inwook Shim},
journal= {arXiv preprint arXiv:2506.14144},
year = {2025}
}