看得见才可信(并预测):基于视觉语言模型的情境感知多人行为预测
计算机视觉与模式识别
2025-12-19 v1 人工智能
摘要
精准预测人类行为对在人群密集环境中运行的移动机器人至关重要。虽然先前研究主要聚焦于从第三人称视角预测单人行为,但several robotic applications require understanding multiple human behaviors from a third-person perspective. 为此,我们提出CAMP-VLM(情境感知多人行为预测):基于视觉语言模型 (VLM) 的框架,融合视觉输入中的情境特征和场景图中的空间感知,以增强对人类-场景互动的预测。由于缺乏适用于第三人称视角下多人行为预测的数据集,我们使用由逼真模拟器生成的合成人类行为数据对CAMP-VLM进行微调,并在合成和真实序列上评估所得模型的泛化能力。利用监督微调 (SFT) 和直接偏好优化 (DPO),CAMP-VLM 在预测准确率上比最佳基线模型提升了最高可达 66.9%。
引用
@article{arxiv.2512.15957,
title = {Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models},
author = {Utsav Panchal and Yuchen Liu and Luigi Palmieri and Ilche Georgievski and Marco Aiello},
journal= {arXiv preprint arXiv:2512.15957},
year = {2025}
}
备注
Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026