中文

DiMo:离散扩散建模用于运动生成与理解

信号处理 2026-02-05 v1

摘要

先前的掩码建模运动生成方法主要研究文本到运动(text-to-motion)。我们提出 DiMo,一种离散扩散风格框架,将掩码建模扩展到双向文本-运动理解与生成。不同于 GPT 风格自回归方法对运动进行 tokenization 并顺序解码,DiMo 执行迭代掩码 token 精炼,统一 Text-to-Motion(T2M)、Motion-to-Text(M2T)和 text-free Motion-to-Motion(M2M)于单一模型。这种解码范式天然 enables 通过 refinement 步数数实现 quality-latency trade-off。我们进一步通过残差向量量化(RVQ)提升运动 token 保真度,并通过 Group Relative Policy Optimization(GRPO)增强对齐性和可控性。在 HumanML3D 和 KIT-ML 上的实验显示,DiMo 在统一框架下展现出强大的运动质量和具竞争力的双向理解能力。此外,我们演示了在无需架构更改的情况下实现 text-free 运动完成、text-guided 运动预测和运动标题纠正的模型能力。附加的定性结果可在项目页面获取:https://animotionlab.github.io/DiMo/。

关键词

引用

@article{arxiv.2602.04187,
  title  = {GPINND: A deep-learning-based state of health estimation for Lithium-ion battery},
  author = {Yuzhu Lei and Guanding Yu},
  journal= {arXiv preprint arXiv:2602.04187},
  year   = {2026}
}