探索式状态表示学习
机器学习
2022-02-16 v2 机器人学
摘要
已知缺乏紧凑且有意义的表示会显著增加强化学习(RL)的复杂度。因此,在处理RL任务前执行状态表示学习(SRL)可能有用。然而,仅当观测到大量多样性转移时才能获得良好状态表示,这可能需要困难的探索,尤其在环境初始无奖励时。为并行解决探索与SRL问题,我们提出称为XSRL(探索式状态表示学习)的新方法。一方面,它联合学习紧凑状态表示与状态转移估计器,后者用于从表示中移除不可利用信息。另一方面,它持续训练逆模型,并将该模型的预测误差加上 步学习进展奖励以构成发现策略的最大化目标。这得到一种寻求复杂转移的策略,从中训练模型可有效学习。我们的实验结果表明,该方法在具图像观测的挑战性环境中实现高效探索,且状态表示显著加速RL任务中的学习。
引用
@article{arxiv.2109.13596,
title = {Exploratory State Representation Learning},
author = {Astrid Merckling and Nicolas Perrin-Gilbert and Alex Coninx and Stéphane Doncieux},
journal= {arXiv preprint arXiv:2109.13596},
year = {2022}
}