中文

看得见才可信(并预测):基于视觉语言模型的情境感知多人行为预测

计算机视觉与模式识别 2025-12-19 v1 人工智能

摘要

精准预测人类行为对在人群密集环境中运行的移动机器人至关重要。虽然先前研究主要聚焦于从第三人称视角预测单人行为,但several robotic applications require understanding multiple human behaviors from a third-person perspective. 为此,我们提出CAMP-VLM(情境感知多人行为预测):基于视觉语言模型 (VLM) 的框架,融合视觉输入中的情境特征和场景图中的空间感知,以增强对人类-场景互动的预测。由于缺乏适用于第三人称视角下多人行为预测的数据集,我们使用由逼真模拟器生成的合成人类行为数据对CAMP-VLM进行微调,并在合成和真实序列上评估所得模型的泛化能力。利用监督微调 (SFT) 和直接偏好优化 (DPO),CAMP-VLM 在预测准确率上比最佳基线模型提升了最高可达 66.9%。

关键词

引用

@article{arxiv.2512.15957,
  title  = {Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models},
  author = {Utsav Panchal and Yuchen Liu and Luigi Palmieri and Ilche Georgievski and Marco Aiello},
  journal= {arXiv preprint arXiv:2512.15957},
  year   = {2025}
}

备注

Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026