中文

图像到视频模型能否模拟行人动力学?

计算机视觉与模式识别 2025-10-21 v1

摘要

近期基于扩散转换器(DiT)变体的高性能图像到视频(I2V)模型,凭借在大规模视频数据集上的训练,展现了惊人的内在世界模型构建能力。我们调查这些模型是否能够在拥挤的公共场所生成真实的行人运动模式。我们的框架以从行人轨迹基准数据集中提取的关键帧为条件,评估其轨迹预测性能。

关键词

引用

@article{arxiv.2510.17731,
  title  = {Can Image-To-Video Models Simulate Pedestrian Dynamics?},
  author = {Aaron Appelle and Jerome P. Lynch},
  journal= {arXiv preprint arXiv:2510.17731},
  year   = {2025}
}

备注

Appeared in the ICML 2025 Workshop on Building Physically Plausible World Models, July 2025, https://physical-world-modeling.github.io/