中文

SeRO:用于分布外情形自恢复的自监督强化学习方法

机器学习 2023-11-08 v1 人工智能 机器人学

摘要

使用强化学习训练的机器人智能体存在在分布外(OOD)状态下采取不可靠动作的问题。由于智能体在训练期间几乎不可能访问并学习整个状态空间,它们在真实世界环境中很容易变为OOD。遗憾的是,不可靠动作无法保证智能体成功执行其原始任务。因此,智能体应当能够识别自身是否处于OOD状态,并学习如何返回已学习的状态分布,而非继续采取不可靠动作。在本研究中,我们提出一种新颖方法,当智能体陷入OOD状态时,以自监督方式对其重新训练以从OOD情形中恢复。我们深入的实验结果表明,我们的方法在样本效率与原始任务性能恢复方面显著提升了智能体从OOD情形中恢复的能力。此外,我们表明即便通过探索难以访问分布内状态,我们的方法仍能重新训练智能体从OOD情形中恢复。

关键词

引用

@article{arxiv.2311.03651,
  title  = {SeRO: Self-Supervised Reinforcement Learning for Recovery from Out-of-Distribution Situations},
  author = {Chan Kim and Jaekyung Cho and Christophe Bobda and Seung-Woo Seo and Seong-Woo Kim},
  journal= {arXiv preprint arXiv:2311.03651},
  year   = {2023}
}

备注

9 pages, 5 figures. Proceedings of the 32nd International Joint Conference on Artificial Intelligence, 2023