PEAC:跨体现在强化学习中的无监督预训练
机器学习
2025-05-20 v2
摘要
在强化学习 (RL) 中,设计具备适应性力体现多样性并能适应不同 embodiment 的通用代理人已取得显著关注,这对于将 RL 代理人部署到各种实际应用场景至关重要。先前的跨体现在强化学习方法专注于在特定任务内将知识在不同 embodiment 之间进行迁移。这些方法常导致知识与特定任务紧密耦合,难以充分捕捉不同 embodiment 的独特特征。为克服这一局限,我们引入跨体现在强化学习无监督 (CEURL) 的概念,这种方法利用无监督学习使代理人通过在无奖励环境中的在线交互获取 embodiment 感知和任务中性知识。我们将 CEURL 表述为一种新的受控 embodiment 马尔可夫决策过程 (CE-MDP),并在 CE-MDP 框架下系统分析 CEURL 的预训练目标。基于这些分析,我们开发了一种用于处理 CEURL 的新型算法 Pre-trained Embodiment-Aware Control (PEAC),其集成了专为跨 embodiment 预训练设计的内在奖励函数。PEAC 不仅为跨 embodiment 预训练提供了直观的优化策略,也可以灵活地与现有的无监督 RL 方法集成,促进跨 embodiment 的探索和技能发现。大量实验在模拟环境(如 DMC 和 Robosuite)和实际环境(如四足 locomotion)中表明,PEAC 在适应性性能和跨 embodiment 泛化方面显著提升,展示了其在克服 CEURL 独特挑战方面的有效性。项目页面和代码请访问 https://yingchengyang.github.io/ceurl。
引用
@article{arxiv.2405.14073,
title = {PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning},
author = {Chengyang Ying and Zhongkai Hao and Xinning Zhou and Xuezhou Xu and Hang Su and Xingxing Zhang and Jun Zhu},
journal= {arXiv preprint arXiv:2405.14073},
year = {2025}
}
备注
NeurIPS24