REFINE-DP:基于强化学习的扩散策略人形体Loco-manipulation微调
应用统计
2026-03-17 v1
摘要
人形体Loco-manipulation需要在复杂的机器人-环境动力学和长期任务下,协调高层运动计划与稳定的低层全身执行。虽然扩散策略(Diffusion Policy, DP)在从演示中学习方面显示出前景,但在人形体机器人上部署仍面临关键挑战:离线训练的运动规划器与低层控制器解耦,导致命令跟踪不佳、分布迁移叠加、任务失败。规模化演示数据的常规做法对高维人形体系统而言代价高昂。为此,我们提出REFINE-DP(REinforcement learning FINE-tuning of Diffusion Policy),一个分层框架,联合优化DP高层规划器和基于强化学习的低层Loco-manipulation控制器。通过基于PPO的扩散策略梯度对DP进行微调,以提高任务成功率,同时更新控制器以准确跟踪规划器演化的命令分布,减少导致运动质量下降的分布差异。我们在人形体机器人上进行Loco-manipulation任务的验证,包括门体穿越和长期物体运输。REFINE-DP在仿真环境中实现了超过90%的成功率,甚至在预训练数据中未出现的超出分布案例中也能实现平滑的自主任务执行。我们的方法显著优于预训练的DP基线,表明强化学习微调是实现可靠人形体Loco-manipulation的关键。https://refine-dp.github.io/REFINE-DP/
引用
@article{arxiv.2603.13706,
title = {When Does Agroforestry Income Reduce Deforestation? Evidence from a Natural Experiment in Madagascar},
author = {Camille DeSisto and Ranaivo Rasolofoson and Michelle Foley and Harsh Parikh},
journal= {arXiv preprint arXiv:2603.13706},
year = {2026}
}