融合基于骨架的动作识别与文本到运动生成
计算机视觉与模式识别
2026-04-21 v1
摘要
人体动作识别和运动生成是人机交互计算机视觉中的两个活跃研究问题,两者都旨在将运动与文本语义对齐。然而,大多数现有工作是分别研究这两个问题,没有发现它们之间的联系,即运动生成需要语义理解。本 work 研究通过利用骨架坐标进行统一的动作识别和运动生成。我们提出坐标基自动回归运动扩散(CoAMD),以粗到细的方式合成运动。作为 CoAMD 的核心组件,我们设计了一个多模态动作识别器(MAR),为运动生成提供梯度基的语义指导。此外,我们在绝对坐标上评估基线,建立了严格的基准。我们的模型可应用于四个重要任务,包括基于骨架的动作识别、文本到运动生成、文本-运动检索和运动编辑。在13个基准测试上的大量实验表明,我们的方法在性能上实现了最先进水平,凸显其在人类运动建模方面的有效性和通用性。代码可在 https://github.com/jidongkuang/CoAMD 获取。
引用
@article{arxiv.2604.17090,
title = {Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition},
author = {Jidong Kuang and Hongsong Wang and Jie Gui},
journal= {arXiv preprint arXiv:2604.17090},
year = {2026}
}