MotionGRPO:克服GRPO-based egocentric motion recovery中样本间低多样性的问题
计算机视觉与模式识别
2026-05-13 v2
摘要
本文研究了来自头戴式设备信号的全身3D人体运动恢复问题。现有的基于扩散的方法常依赖全局分布匹配,导致局部关节重建误差。我们提出MotionGRPO,一种新型框架利用强化学习后训练为扩散过程注入细粒度引导。技术上,我们将扩散采样建模为马尔可夫决策过程,通过组相对政策优化(GRPO)进行优化。为此,我们引入一种混合奖励机制,结合用于全局视觉可行性的学习条件感知模型和用于局部关节精度的显式约束。我们的关键技术洞见是,基于扩散的恢复由于样本间多样性有限,导致梯度消失。为此,我们进一步引入一种噪声注入策略,显式增加样本方差并稳定学习。大量实验表明,MotionGRPO以卓越的视觉保真度实现了最先进的性能。
引用
@article{arxiv.2605.05680,
title = {MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery},
author = {Nanjie Yao and Junlong Ren and Wenhao Shen and Hao Wang},
journal= {arXiv preprint arXiv:2605.05680},
year = {2026}
}
备注
Accepted by ICML 2026