StickMotion:通过绘制棍棍人生成 3D 人体动作
计算机视觉与模式识别
2025-03-10 v1 人工智能
摘要
文本到动作生成将文本描述翻译为人体动作,旨在准确捕捉用户从简单文本输入中想象的详细动作。本文介绍了 StickMotion,一个高效的基于扩散的网络,专为多条件场景设计,可基于传统文本和我们提出的棍棍人条件(分别用于全局和局部控制这些动作)生成所需动作。我们从三个角度解决用户友好棍棍人带来的挑战:1)数据生成。我们开发了一种算法在不同数据集格式下自动生成手绘棍棍人。2)多条件融合。我们提出一种多条件模块集成到扩散过程中,可获得所有可能条件组合的输出,降低计算复杂度并提升 StickMotion 的性能。3)动态监督。我们赋予 StickMotion 在输出序列中对棍棍人位置进行微小调整的能力,通过我们提出的动态监督策略生成更自然的动作。通过定量实验和用户研究,绘制棍棍人可节省约 51.5% 的时间,使生成的动作更符合用户想象。我们的代码、演示和相关数据将公开,以促进科学界进一步的研究与验证。
引用
@article{arxiv.2503.04829,
title = {StickMotion: Generating 3D Human Motions by Drawing a Stickman},
author = {Tao Wang and Zhihua Wu and Qiaozhi He and Jiaming Chu and Ling Qian and Yu Cheng and Junliang Xing and Jian Zhao and Lei Jin},
journal= {arXiv preprint arXiv:2503.04829},
year = {2025}
}
备注
11 pages, 5 figures, accepted by CVPR2025