从带有噪声标签的网络视频中学习生成多样化的行人运动
计算机视觉与模式识别
2024-10-11 v1
摘要
理解和建模现实世界中的行人运动对于运动预测和场景模拟等应用至关重要。许多因素影响行人运动,例如场景上下文、个体特征和目标,这些因素往往被现有的人类生成方法所忽略。网络视频包含自然的行人行为和丰富的运动上下文,但使用预训练预测器对其进行标注会产生噪声标签。在这项工作中,我们提出从网络视频中学习多样化的行人运动。我们首先整理了一个名为CityWalkers的大规模数据集,该数据集捕捉了城市场景中多样化的真实世界行人运动。然后,基于CityWalkers,我们提出了一种名为PedGen的生成模型,用于多样化的行人运动生成。PedGen引入了自动标签过滤以去除低质量标签,以及一个掩码嵌入以使用部分标签进行训练。它还包含一个新颖的上下文编码器,将2D场景上下文提升到3D,并能够整合各种上下文因素,以生成城市场景中逼真的行人运动。实验表明,PedGen通过学习噪声标签并整合上下文因素,在行人运动生成方面优于现有的基线方法。此外,PedGen在现实世界和模拟环境中都实现了零样本泛化。代码、模型和数据将在 https://genforce.github.io/PedGen/ 公开提供。
引用
@article{arxiv.2410.07500,
title = {Learning to Generate Diverse Pedestrian Movements from Web Videos with Noisy Labels},
author = {Zhizheng Liu and Joe Lin and Wayne Wu and Bolei Zhou},
journal= {arXiv preprint arXiv:2410.07500},
year = {2024}
}
备注
Project Page: https://genforce.github.io/PedGen/