基于条件神经过程的无监督元测试混合型元强化学习
机器学习
2025-06-06 v1 人工智能
机器人学
摘要
我们提出了一种名为无监督元测试条件神经过程 (UMCNP) 的新型混合型少样本元强化学习 (元 RL) 方法,该方法独特地结合了参数化策略梯度基于元学习 (PPG) 和基于任务推断的少样本元 RL,同时保持明确的区分。针对在元测试期间奖励信号缺失的情形,我们的方法无需额外地在元训练中获取样本即可提高样本效率。UMCNP 利用条件神经过程 (CNP) 的效率和可扩展性,以减少元测试期间所需的在线交互次数。在元训练期间,之前通过 PPG 元 RL 收集的样本可以高效地以离线方式复用以学习任务推断。UMCNP 从单个具有未知参数的测试任务 rollout 中推断转移动态模型的潜在表示。该方法允许我们通过与所学动态模型交互来生成自适应 rollout。在 2D-点智能体和连续控制元 RL 基准测试中,我们的方法在元测试期间的样本数显著少于基线方法,包括带有未知角度传感器偏置的 cartpole 和具有随机化动力学参数的 walker 智能体。
引用
@article{arxiv.2506.04399,
title = {Unsupervised Meta-Testing with Conditional Neural Processes for Hybrid Meta-Reinforcement Learning},
author = {Suzan Ece Ada and Emre Ugur},
journal= {arXiv preprint arXiv:2506.04399},
year = {2025}
}
备注
Published in IEEE Robotics and Automation Letters Volume: 9, Issue: 10, 8427 - 8434, October 2024. 8 pages, 7 figures