LaMoGen:基于兰坎运动分析的扩散文本到运动生成
计算机视觉与模式识别
2025-10-14 v2 人工智能
摘要
多样化的人类运动生成正成为计算机视觉、人机交互和动画等领域的重要任务。虽然基于扩散模型的文本到运动合成已在生成高质量运动方面取得成功,但实现细粒度表达运动控制仍是重大挑战。这源于数据集中运动风格多样性不足以及自然语言难以表达定量特征。兰坎运动分析广泛用于表达运动细节,使其质量尽可能一致。 inspired by this,本工作旨在通过无缝整合兰坎Effort和Shape分量的定量方法,实现对人类运动生成的可解释且富有表达力的控制。我们提出的方法为零样本、推理时优化方法,无需额外运动数据即可通过在采样步骤中更新预训练扩散模型的文本嵌入来实现对所需兰坎Effort和Shape分量的引导。我们展示,本方法成功操控运动属性,生成具有目标兰坎标签的多样化表达运动质感,同时保持运动身份。
引用
@article{arxiv.2509.24469,
title = {LaMoGen: Laban Movement-Guided Diffusion for Text-to-Motion Generation},
author = {Heechang Kim and Gwanghyun Kim and Se Young Chun},
journal= {arXiv preprint arXiv:2509.24469},
year = {2025}
}