受约束的从不完美演示中学习风格 under 任务最优性
机器人学
2025-09-24 v2
摘要
从演示中学习已被证明在机器人中有效,用于获取自然行为,如风格化运动和逼真的灵活性,尤其是在难以明确定义风格导向奖励函数时。 synthesizing 风格化运动用于实际任务通常需要在任务性能和仿真质量之间进行权衡。现有方法通常依赖与任务目标高度一致的专家演示。然而,实际演示常常不完整或不现实,导致当前方法在牺牲任务性能的情况下提升风格。为解决此问题,我们提出将问题表述为受约束的马尔可夫决策过程(CMDP)。具体而言,我们以约束维持接近最优任务性能为目标,优化风格仿真目标。我们引入一种可适应调整的拉格朗日乘子,以引导智能体有选择性地仿真演示,捕捉风格细微差别而不损害任务性能。我们在多个机器人平台和任务上验证了该方法,展示了稳健的任务性能和高保真的风格学习。在ANYmal-D硬件上,我们展示了机械能耗降低14.5%,并呈现更灵活的步态模式,展示了实际应用中的实际收益。
引用
@article{arxiv.2507.09371,
title = {Constrained Style Learning from Imperfect Demonstrations under Task Optimality},
author = {Kehan Wen and Chenhao Li and Junzhe He and Marco Hutter},
journal= {arXiv preprint arXiv:2507.09371},
year = {2025}
}
备注
This paper has been accepted to CoRL 2025