PIP-Net:自然场景下的行人意图预测
计算机视觉与模式识别
2025-07-08 v3 人工智能
神经与进化计算
图像与视频处理
机器学习
摘要
自动驾驶车辆(AVs)准确的行人意图预测(PIP)是该领域当前的研究挑战之一。在本文中,我们介绍了 PIP-Net,这是一种旨在预测自动驾驶车辆在真实城市场景中行人过马路意图的新颖框架。我们提供了针对不同摄像头安装位置和配置设计的两种 PIP-Net 变体。利用驾驶场景中的运动学数据和空间特征,所提出的模型采用了基于循环和时间注意力的解决方案,性能超越了现有水平。为了增强道路使用者及其与自车接近度的视觉表示,我们引入了类别深度特征图,结合局部运动流特征,为场景动态提供了丰富的洞察。此外,我们探索了扩展相机视野的影响,从环绕自车的一个相机扩展到三个相机,从而增强了模型的上下文感知能力。根据交通场景和道路环境的不同,该模型在提前至多 4 秒预测行人过马路意图方面表现出色,这是当前行人意图预测研究中的一项突破。最后,我们首次提出了 Urban-PIP 数据集,这是一个定制的行人意图预测数据集,包含真实世界自动驾驶场景中的多相机标注。
引用
@article{arxiv.2402.12810,
title = {PIP-Net: Pedestrian Intention Prediction in the Wild},
author = {Mohsen Azarmi and Mahdi Rezaei and He Wang},
journal= {arXiv preprint arXiv:2402.12810},
year = {2025}
}
备注
Author Accepted Version in IEEE Transactions on Intelligent Transportation Systems