KinMo:面向人类运动理解与生成的运动学感知框架
计算机视觉与模式识别
2025-08-05 v3 人工智能
图形学
摘要
当前的人类运动合成框架依赖于全局动作描述,导致模态间存在不匹配,限制了运动理解和生成能力。单一的粗糙描述,如跑步,无法捕捉速度、肢体位置和运动学动态等细节,导致文本与运动模态之间存在歧义。为解决这一挑战,我们引入了 KinMo,一个基于层次可描述运动表示的统一框架,其超越全局动作,融合运动学群体运动及其相互作用。我们设计了一个自动标注管道,用于生成这种分解的高质量、细粒度描述,形成 KinMo 数据集,为数据丰富提供可扩展且高效的解决方案。为利用这些结构化描述,我们提出了层次文本-运动对齐方式,逐步整合额外的运动细节,从而提高语义运动理解。此外,我们引入了粗到细运动生成程序,以利用增强的空间理解来提高运动合成。实验结果表明,KinMo 在运动理解方面显著提升,体现在增强的文本-运动检索性能上,并实现更细粒度的运动生成和编辑能力。项目页面:https://andypinxinliu.github.io/KinMo
引用
@article{arxiv.2411.15472,
title = {KinMo: Kinematic-aware Human Motion Understanding and Generation},
author = {Pengfei Zhang and Pinxin Liu and Pablo Garrido and Hyeongwoo Kim and Bindita Chaudhuri},
journal= {arXiv preprint arXiv:2411.15472},
year = {2025}
}
备注
Accepted to ICCV 2025; Project page: https://andypinxinliu.github.io/KinMo