基于偏好优化的物理学致谅人类运动 PhysMoDPO
机器学习
2026-03-17 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
最近的文本条件人类运动生成进展主要依赖于在大规模人类运动数据上训练的扩散模型。基于此进展,近期方法尝试通过应用全身控制器(WBC)将此类模型用于人物动画和真实机器人控制,将扩散生成的运动转换为可执行轨迹。虽然 WBC 生成的轨迹遵循物理规律,但可能暴露出与原始运动显著偏差。为此,我们提出 PhysMoDPO,直接偏好优化框架。不同于依赖脚步滑动惩罚等手工设计的物理感知启发式方法,我们将 WBC 集成到训练管道中,并优化扩散模型,使其输出的 WBC 既符合物理规律,又符合原始文本指令。为训练 PhysMoDPO,我们部署基于物理的和任务特定的奖励函数,用于对合成轨迹分配偏好。我们在文本到运动和空间控制任务上进行了广泛实验,证明 PhysMoDPO 在模拟机器人上的物理真实性和任务相关指标方面均实现了一致的改进。此外,我们展示了 PhysMoDPO 在模拟中的零样本运动迁移以及 G1 人形机器人上的实际部署中均取得显著的改进。
引用
@article{arxiv.2603.13228,
title = {PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization},
author = {Yangsong Zhang and Anujith Muraleedharan and Rikhat Akizhanov and Abdul Ahad Butt and Gül Varol and Pascal Fua and Fabio Pizzati and Ivan Laptev},
journal= {arXiv preprint arXiv:2603.13228},
year = {2026}
}
备注
Project page: https://mael-zys.github.io/PhysMoDPO/