中文

PEARL:面向机器人操作的零样本跨任务偏好对齐与鲁棒奖励学习

机器学习 2024-06-06 v2

摘要

在基于偏好的强化学习 (RL) 中,获取大量偏好标签既耗时又昂贵。此外,所查询的人类偏好无法用于新任务。本文提出零样本跨任务偏好对齐与鲁棒奖励学习 (PEARL),它从跨任务偏好迁移中学习策略,而无需目标任务的任何人类标签。我们的贡献包括两个促进迁移与学习过程的新颖组件。其一是跨任务偏好对齐 (CPA),它通过最优传输在任务间迁移偏好。CPA 的关键思想是使用 Gromov-Wasserstein 距离对齐任务间的轨迹,所求解的最优传输矩阵作为轨迹间的对应关系。目标任务偏好计算为源任务偏好标签以对应关系为权重的加权和。此外,为确保从这些迁移标签中鲁棒学习,我们引入鲁棒奖励学习 (RRL),其通过将奖励建模为高斯分布来同时考虑奖励均值与不确定性。在来自 Meta-World 和 Robomimic 的机器人操作任务上的实证结果表明,我们的方法能够准确跨任务迁移偏好标签,并进而学习到表现良好的策略。值得注意的是,当人类偏好较少时,我们的方法显著超越现有方法。我们方法的代码与视频见:https://sites.google.com/view/pearl-preference。

关键词

引用

@article{arxiv.2306.03615,
  title  = {PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation},
  author = {Runze Liu and Yali Du and Fengshuo Bai and Jiafei Lyu and Xiu Li},
  journal= {arXiv preprint arXiv:2306.03615},
  year   = {2024}
}

备注

Accepted to ICML 2024