中文

基于文本与少量动作帧的渐进式人体动作生成

计算机视觉与模式识别 2025-04-03 v2

摘要

尽管现有的文本到动作(T2M)方法能够根据文本描述生成逼真的人体动作,但由于仅靠文本不足以精确描述各种姿态,因此仍难以使生成的动作与期望姿态对齐。为了实现更具可控性的生成,一种直观的方式是允许用户输入少量描述精确期望姿态的动作帧。因此,我们探索了一项新的文本-帧到动作(TF2M)生成任务,旨在根据文本和极少量给定帧生成动作。直观上,某一帧距离给定帧越近,在该给定帧条件下该帧的不确定性越低。因此,我们提出了一种新颖的渐进式动作生成(PMG)方法,在多个阶段中从低不确定性的帧逐步生成至高不确定性的帧。在每个阶段,Text-Frame Guided Generator在文本的帧感知语义、给定帧以及前一阶段生成帧的条件下生成新帧。此外,为缓解测试时因多阶段累积错误生成帧导致的训练-测试差异,我们提出了一种用于训练的伪帧替换策略。实验结果表明,即便仅给定一帧,我们的PMG也大幅优于现有的T2M生成方法,验证了PMG的有效性。代码可在 https://github.com/qinghuannn/PMG 获取。

关键词

引用

@article{arxiv.2503.13300,
  title  = {Progressive Human Motion Generation Based on Text and Few Motion Frames},
  author = {Ling-An Zeng and Gaojie Wu and Ancong Wu and Jian-Fang Hu and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2503.13300},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2025