面向任务的误差运动先验下的策略优化
机器人学
2026-02-04 v2 机器学习
摘要
人oid 控制常利用人类演示中的运动先验以鼓励自然行为。然而,这些演示常因本体差异、 retargeting 错误以及与任务无关的变体而次优或偏离机器人任务,导致直接模仿会降低任务性能。相反,仅基于任务的强化学习可获得多种任务最优解,常导致不自然或不稳定的运动。这暴露了对抗性模仿学习中线性奖励混合的根本局限。我们提出“任务导向运动先验”(Task-Centric Motion Priors, TCMP),一种面向任务的对抗性模仿框架,将模仿视为条件正则化器而非平等目标。TCMP 在最大化任务改进的同时,仅在模仿信号与任务进度兼容时纳入模仿,从而实现自适应、几何感知的更新,保留任务可行的下降方向,抑制误差模仿中的有害影响。我们对梯度冲突与任务优先稳态点进行理论分析,并通过人oid 控制实验验证,在噪声演示下均能实现稳健的任务性能与持续的运动风格。
引用
@article{arxiv.2601.19411,
title = {Task-Centric Policy Optimization from Misaligned Motion Priors},
author = {Ziang Zheng and Kai Feng and Yi Nie and Shentao Qin},
journal= {arXiv preprint arXiv:2601.19411},
year = {2026}
}
备注
Work requires further details and not complete yet