中文

面向可解释文本到运动生成与编辑的姿态引导残差精炼

计算机视觉与模式识别 2025-12-30 v1 机器人学

摘要

基于文本的3D运动生成旨在自动合成多样化运动以延扩展用户的创造力,而运动编辑则响应文本修改现有运动序列,同时保持其整体结构。基于姿态代码的框架如CoMo将可量化的姿态属性映射到离散的姿态代码,以支持可解释的运动控制,但其帧级表示难以捕捉细微的时序动态和高频细节,常导致重建保真度下降和局部可控性受损。为解决这一局限性,我们引入姿态引导残差精炼用于运动(PGR2^2M),这是一种混合表示,为可解释姿态代码增添了通过残差向量量化(RVQ)学习的残差代码。姿态引导的RVQ标记器将运动分解为编码粗全局结构的姿态潜在变量和建模细粒度时序变化的残差潜在变量。残差丢弃进一步抑制对残差的过度依赖,保留姿态代码的语义对齐和可编辑性。在该标记器之上,一个基础Transformer自回归地从文本预测姿态代码,一个精炼Transformer在文本、姿态代码和量化阶段条件下预测残差代码。在HumanML3D和KIT-ML上的实验表明,PGR2^2M在生成和编辑方面相较于CoMo和最近的扩散-基于和基于标记的基线,提高了Fréchet距离和重建指标,用户研究确认它实现了直观的、结构保持的运动编辑。

关键词

引用

@article{arxiv.2512.22464,
  title  = {Pose-Guided Residual Refinement for Interpretable Text-to-Motion Generation and Editing},
  author = {Sukhyun Jeong and Yong-Hoon Choi},
  journal= {arXiv preprint arXiv:2512.22464},
  year   = {2025}
}