基于想象的行动:基于模型的强化学习中何时信任想象轨迹
人工智能
2024-07-31 v6 机器学习
摘要
基于模型的强化学习(MBRL)旨在学习能够预测其动作结果的环境动力学模型。模型的前向应用产生所谓的想象轨迹(动作、预测状态-奖励的序列),用于优化最大化期望奖励的候选动作集合。其结果——一条理想的想象轨迹或计划——是不完美的,且典型 MBRL 依赖模型预测控制(MPC)通过持续从头重新规划来克服这一点,从而在具有更长后退视界的任务中带来重大计算成本并增加复杂性。我们提出用于在线评估想象轨迹的不确定性估计方法,以判断进一步规划的动作是否可被信任以交付可接受的奖励。这些方法包括将执行最后一个动作后的误差与标准期望误差进行比较,以及利用模型不确定性来评估与期望结果的偏差。此外,我们引入利用动力学模型前向传播的方法,以评估计划的剩余部分是否与期望结果一致,并根据期望奖励评估计划的剩余部分。我们的实验通过在射击式 MBRL 设置中应用所提方法来避免不必要的轨迹重规划,证明了这些不确定性估计方法的有效性。结果突显了在不牺牲性能的情况下计算成本的显著降低。
引用
@article{arxiv.2105.05716,
title = {Acting upon Imagination: when to trust imagined trajectories in model based reinforcement learning},
author = {Adrian Remonda and Eduardo Veas and Granit Luzhnica},
journal= {arXiv preprint arXiv:2105.05716},
year = {2024}
}