中文

CoMA:基于多模态智能体的组合式人体运动生成

计算机视觉与模式识别 2025-01-09 v2

摘要

三维人体运动生成近年来取得了显著进展。尽管最先进的方法已大幅提升了性能,但由于运动数据集稀缺以及生成新训练样本的成本高昂,它们仍然难以处理训练数据中未出现的复杂和精细运动。为应对这些挑战,我们提出了 CoMA,一种基于智能体的复杂人体运动生成、编辑与理解解决方案。CoMA 利用多个由大语言模型和视觉模型驱动的协作智能体,以及一个基于掩码变换器的运动生成器,该生成器具有面向身体部位的专用编码器和代码本,以实现细粒度控制。我们的框架支持在详细指令下生成短序列和长序列运动,实现文本引导的运动编辑和自我修正以提升质量。在 HumanML3D 数据集上的评估表明,我们的方法与最先进方法相比具有竞争力。此外,我们构建了一组上下文丰富、具有组合性和长文本的提示词,用户研究表明我们的方法显著优于现有方法。

关键词

引用

@article{arxiv.2412.07320,
  title  = {CoMA: Compositional Human Motion Generation with Multi-modal Agents},
  author = {Shanlin Sun and Gabriel De Araujo and Jiaqi Xu and Shenghan Zhou and Hanwen Zhang and Ziheng Huang and Chenyu You and Xiaohui Xie},
  journal= {arXiv preprint arXiv:2412.07320},
  year   = {2025}
}

备注

Project Page: https://gabrie-l.github.io/coma-page/