PALMER:带记忆的感知-动作回路用于长视野规划
机器人学
2022-12-12 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
为在事先未知的的真实世界场景中实现自主性,智能体应能够:i)从高维感官观测(如图像)行动,ii)从过往经验中学习以适应并改进,以及 iii)具备长视野规划能力。经典规划算法(如PRM、RRT)擅长处理长视野规划;而基于深度学习的方法可通过建模观测间的统计关联来提供解决其他问题的必要表征。在此方向上,我们引入一种称为PALMER的通用规划算法,其将经典基于采样的规划算法与基于学习的感知表征相结合。为训练这些感知表征,我们将Q-learning与对比表征学习结合,以创建一个潜在空间,其中两个状态嵌入间的距离刻画了最优策略在二者间转移的难易程度。为利用这些感知表征进行规划,我们重新调整经典基于采样的规划算法,从回放缓冲区中检索先前观测到的轨迹段,并将其重新拼接为连接任意给定起始与目标状态的近似最优路径。这在表征学习、记忆、强化学习与基于采样的规划间创建了紧密的反馈回路。最终成果是一个经验性框架,其长视野规划相比现有方法显著更鲁棒且样本高效。
引用
@article{arxiv.2212.04581,
title = {PALMER: Perception-Action Loop with Memory for Long-Horizon Planning},
author = {Onur Beker and Mohammad Mohammadi and Amir Zamir},
journal= {arXiv preprint arXiv:2212.04581},
year = {2022}
}
备注
Website: https://palmer.epfl.ch