强化学习中用于三维旋转的 Bingham 策略参数化
机器人学
2022-02-09 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
我们提出一种新的策略参数化方法,用于在强化学习中表示三维旋转。当今连续控制强化学习文献中,许多随机策略参数化是高斯的。我们认为,并非所有环境都适宜普遍采用高斯策略参数化。其中一个尤其如此的情况是涉及预测三维旋转输出的任务,无论是单独预测,还是作为完整 6D 位姿输出的一部分与平移耦合。我们提出的 Bingham 策略参数化(BPP)对 Bingham 分布建模,并在一系列强化学习任务中相比高斯策略参数化实现更好的旋转(四元数)预测。我们在旋转 Wahba 问题任务以及来自 RLBench 的一组基于视觉的下一最佳位姿机器人操作任务上评估了 BPP。我们希望本文能鼓励更多研究去开发更适用于特定环境的其他策略参数化,而非总是假设高斯。
引用
@article{arxiv.2202.03957,
title = {Bingham Policy Parameterization for 3D Rotations in Reinforcement Learning},
author = {Stephen James and Pieter Abbeel},
journal= {arXiv preprint arXiv:2202.03957},
year = {2022}
}
备注
Project page and code: https://sites.google.com/view/rl-bpp