DyCrowd:大场景视频中动态人群重建
计算机视觉与模式识别
2025-08-19 v1
摘要
大场景中的动态人群3D重建日益重要,适用于城市监视和人群分析等应用。然而,现有工作试图从静态图像重建3D人群,导致时序一致性不足,无法缓解典型遮挡问题。本文提出DyCrowd,即首个针对大场景视频中数百个个体姿态、位置和形状进行时空一致的3D重建框架。我们设计了一种粗到细的群体引导运动优化策略,用于大场景下的遮挡鲁棒人群重建。为解决时序不稳定和严重遮挡问题,进一步引入基于变分自编码器(VAE)的人体运动先验,以及基于分段层次的群体引导优化。我们的策略核心在于利用群体的集体行为来应对长期动态遮挡。通过联合优化具有相似运动分段的个体运动序列,并结合提出的异步运动一致性(AMC)损失,使高质量的无遮挡运动段能够指导被遮挡运动段的恢复,确保即使在时序不同步和节律不一致的情况下,仍能实现稳健且合理的运动恢复。此外,为弥补现有缺乏良好标注大场景视频数据集的不足,我们贡献了一个虚拟基准数据集VirtualCrowd,用于评估大场景视频中的动态人群重建。实验结果表明,所提方法在大场景动态人群重建任务中实现了最先进的性能。代码和数据集将提供给研究者使用。
引用
@article{arxiv.2508.12644,
title = {DyCrowd: Towards Dynamic Crowd Reconstruction from a Large-scene Video},
author = {Hao Wen and Hongbo Kang and Jian Ma and Jing Huang and Yuanwang Yang and Haozhe Lin and Yu-Kun Lai and Kun Li},
journal= {arXiv preprint arXiv:2508.12644},
year = {2025}
}