用于机器人长期强化学习的预训练贝叶斯非参数知识先验
机器人学
2025-03-31 v1 人工智能
摘要
强化学习方法通常从头开始学习新任务,常常忽视可加速学习过程的先前知识。虽然有些方法包含先前学习的技能,但通常依赖于单一高斯分布等固定结构来定义技能先验。这种刚性假设会限制技能的多样性和灵活性,尤其是在复杂的长期任务中。在本工作中,我们引入一种方法,将潜在的原始技能动作建模为具有未知底层特征数的非参数属性。我们利用贝叶斯非参数模型——具体为Dirichlet过程混合模型,增强了出生和合并启发式方法——来预训练一个能有效捕捉技能多样性的技能先验。此外,所学技能在先验空间中具有明确的可追踪性,增强了可解释性和控制能力。通过将这一灵活的技能先验集成到强化学习框架中,我们的方法在长期操作任务中超越了现有方法,实现了更高效的技能迁移和复杂环境中的任务成功。在我们的发现表明,技能先验的更丰富、非参数表示显著改善了挑战性机器人任务的学习与执行。所有数据、代码和视频均可在 https://ghiara.github.io/HELIOS/ 获取。
引用
@article{arxiv.2503.21975,
title = {Pretrained Bayesian Non-parametric Knowledge Prior in Robotic Long-Horizon Reinforcement Learning},
author = {Yuan Meng and Xiangtong Yao and Kejia Chen and Yansong Wu and Liding Zhang and Zhenshan Bing and Alois Knoll},
journal= {arXiv preprint arXiv:2503.21975},
year = {2025}
}
备注
initial upload 8 pages