中文

SALAD:基于骨架感知的潜在扩散用于文本驱动的运动生成与编辑

计算机视觉与模式识别 2025-03-19 v1 人工智能 图形学 机器学习

摘要

文本驱动运动生成通过去噪扩散模型取得了显著进展,但以往方法常简化骨骼关节、时间帧和文本词语的表示,限制了其在每个模态及其相互作用中充分捕获信息的能力。此外,使用预训练模型进行下游任务(如编辑)时,通常需要额外的工作,包括手动干预、优化或微调。在本文中,我们引入了骨架感知潜在扩散 (SALAD),该模型显式捕获关节、帧和词语之间的复杂相互关系。 Furthermore,通过利用生成过程中产生的跨注意力图,我们实现了基于注意力的零样文本驱动运动编辑,使用预训练的 SALAD 模型即可完成编辑,无需额外用户输入。我们的 method 在保持生成质量的同时,显著优于先前方法在文本-运动对齐方面,并通过提供多样化的编辑功能展示了其实际灵活性。代码已在项目页面提供。

关键词

引用

@article{arxiv.2503.13836,
  title  = {SALAD: Skeleton-aware Latent Diffusion for Text-driven Motion Generation and Editing},
  author = {Seokhyeon Hong and Chaelin Kim and Serin Yoon and Junghyun Nam and Sihun Cha and Junyong Noh},
  journal= {arXiv preprint arXiv:2503.13836},
  year   = {2025}
}

备注

CVPR 2025; Project page https://seokhyeonhong.github.io/projects/salad/