中文

CrowdMoGen:零-shot 文本驱动的集体运动生成

计算机视觉与模式识别 2025-05-12 v2

摘要

虽然近期文本到运动生成技术取得了令人鼓舞的成果,但它们通常假设所有个体作为单个单元分组,扩展到大规模人群并确保个体对特定事件作出恰当反应仍是挑战。这主要源于场景规划的复杂性,涉及组织团队、规划活动及协调互动,以及可控运动生成。本文提出 CrowdMoGen,首个针对集体运动生成的零-shot 框架,有效组织个体并生成事件对齐运动序列。1)受限于监督式训练场景规划模块可用数据集, 我们提出利用预训练大型语言模型(LLM)组织个体形成不同团队。尽管 LLM 为团队划分提供高层指导,但缺乏人类运动的低层理解。为此,我们进一步提出集成基于 SMPL 的联合先验以生成情境恰当的活动,包括联合轨迹与文本描述。2)为将所分配活动融入生成网络,我们引入集体运动生成器,将活动以联合方式整合到 transformer 网络中,维持多步去噪过程中的空间约束。广泛实验表明,CrowdMoGen 显著优于先前方法,提供逼真、事件驱动且空间连贯的运动序列。作为首个集体运动生成框架,CrowdMoGen 有望推动城市模拟、人群规划等大规模交互环境的应用。

关键词

引用

@article{arxiv.2407.06188,
  title  = {CrowdMoGen: Zero-Shot Text-Driven Collective Motion Generation},
  author = {Yukang Cao and Xinying Guo and Mingyuan Zhang and Haozhe Xie and Chenyang Gu and Ziwei Liu},
  journal= {arXiv preprint arXiv:2407.06188},
  year   = {2025}
}

备注

Project page: https://yukangcao.github.io/CrowdMoGen