中文

DrawMotion:通过自由手绘生成3D人体动作

计算机视觉与模式识别 2026-05-21 v1

摘要

文本到动作生成将文本描述转化为人体动作,面临用户难以通过文本精确表达其预期动作的挑战。为此,本文引入DrawMotion,一个高效的基于扩散的框架,专为多条件场景设计。DrawMotion基于常规文本条件和一种新颖的手绘条件生成动作,分别提供语义和空间控制。具体而言,我们从三个角度解决了从手绘生成细粒度动作的问题:1)自由手绘条件。为准确捕获用户的预期动作而无需繁琐的文本输入,我们开发了一种算法,自动在不同数据集格式下生成手绘棒人图案;2)多条件融合。我们提出一种多条件模块(MCM),集成到扩散过程中,使模型能够在所有可能的条件组合下工作,同时比常规方法降低计算复杂度;3)无训练引导。值得注意的是,DrawMotion中的MCM确保其中间特征位于连续空间中,允许分类器引导梯度更新特征,从而在保持保真度的同时,将生成动作与用户意图对齐。定量实验和用户研究表明,手绘方法在生成符合用户想象的动作时,约减少46.7%的用户时间。代码、演示和相关数据已公开发布于https://github.com/InvertedForest/DrawMotion。

关键词

引用

@article{arxiv.2605.20955,
  title  = {DrawMotion: Generating 3D Human Motions by Freehand Drawing},
  author = {Tao Wang and Lei Jin and Zhihua Wu and Qiaozhi He and Jiaming Chu and Yu Cheng and Junliang Xing and Jian Zhao and Shuicheng Yan and Li Wang},
  journal= {arXiv preprint arXiv:2605.20955},
  year   = {2026}
}