你只活一次:单生命强化学习
机器学习
2022-10-18 v1 人工智能
摘要
强化学习算法通常设计为学习一个可重复且自主完成任务的性能策略,一般从零开始。然而,在许多现实情况下,目标可能不是学习一个可重复执行任务的策略,而仅仅是在单次试验中成功执行一次新任务。例如,想象一个灾难救援机器人被指派从倒塌建筑中检索物品,它无法从人类获得直接监督。它必须在一次测试时间试验中取回该物体,并且必须在应对未知障碍的同时做到这一点,尽管它可利用灾难前对建筑的已有知识。我们形式化了这一问题设定,称之为单生命强化学习(SLRL),其中智能体必须在无干预的单回合内完成任务,利用其先验经验同时应对某种形式的新颖性。SLRL 为研究自主适应陌生情境的挑战提供了自然设定,我们发现为标准回合制强化学习设计的算法在此设定下常难以从分布外状态恢复。受此观察启发,我们提出一种算法, 加权对抗学习(QWALE),其采用分布匹配策略,在新颖情境中利用智能体的先验经验作为引导。我们在若干单生命连续控制问题上的实验表明,基于我们的分布匹配公式的方法成功率高出 20-60%,因为它们能更快地从新颖状态恢复。
引用
@article{arxiv.2210.08863,
title = {You Only Live Once: Single-Life Reinforcement Learning},
author = {Annie S. Chen and Archit Sharma and Sergey Levine and Chelsea Finn},
journal= {arXiv preprint arXiv:2210.08863},
year = {2022}
}
备注
17 pages