评估视频模型作为多人行人轨迹的模拟器
计算机视觉与模式识别
2025-10-24 v1
摘要
大规模视频生成模型在多样化情境中展现出高视觉逼真度,推动人们关注其作为通用世界模拟器的潜力。现有基准主要关注单个主体,而非多人互动场景。然而,多智能体动态在生成视频中的合理性尚未得到验证。我们提出严格的评估方案,基准测试文本到视频(T2V)和图像到视频(I2V)模型作为行人动力学隐式模拟器。对于I2V,我们利用已建立数据集的起始帧,实现与基准视频数据集的比较。对于T2V,我们构建提示套件以探索多样化的行人密度与互动。关键技术是一种无需已知相机参数的从像素空间重建二维鸟瞰视角轨迹的方法。我们的分析显示,领先模型已学习了相当有效的多智能体行为先验。然而,合并与消失的人等失败模式凸显了未来改进的方向。
引用
@article{arxiv.2510.20182,
title = {Evaluating Video Models as Simulators of Multi-Person Pedestrian Trajectories},
author = {Aaron Appelle and Jerome P. Lynch},
journal= {arXiv preprint arXiv:2510.20182},
year = {2025}
}
备注
Preprint, under review