混合离策略RL中的扩散策略以增强探索:用于非抓取操控的应用
机器人学
2025-04-29 v2
摘要
学习多样化的策略以改进非抓取操控技能的迁移和对超出分布情形的泛化至关重要。本工作在混合框架内通过两方面方式增强探索,以处理离散和连续动作空间。首先,将连续运动参数策略建模为扩散模型,其次将其纳入最大熵强化学习框架,以统一离散和连续组件。离散动作空间(如接触点选择)通过Q值函数最大化进行优化,而连续部分则由基于扩散的策略引导。这种混合方法导致一个原则性目标,其中最大熵项通过结构化变分推断得出下界。我们提出了混合扩散策略算法(HyDo),并在仿真和零样本 sim2real 任务上对其进行评估。我们的结果表明,HyDo鼓励更具多样性的行为策略,显著提高了各任务的成功率——例如,在真实世界的6D姿态对齐任务中成功率从53%提升至72%。项目页面:https://leh2rng.github.io/hydo
引用
@article{arxiv.2411.14913,
title = {Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation},
author = {Huy Le and Tai Hoang and Miroslav Gabriel and Gerhard Neumann and Ngo Anh Vien},
journal= {arXiv preprint arXiv:2411.14913},
year = {2025}
}
备注
Accepted for publication in IEEE Robotics and Automation Letters (RA-L)