通过分布匹配训练过渡策略以求解复杂任务
机器学习
2022-03-15 v2 人工智能
摘要
人类将新颖的复杂任务分解为更简单的任务以利用先前习得的技能。类似地,分层强化学习旨在利用简单任务的底层策略来解决复杂任务。然而,由于每个底层策略引发不同的状态分布,从一个底层策略过渡到另一个可能因意外的起始状态而失败。我们引入过渡策略,其通过产生与下一策略所期望的状态和动作分布相匹配的状态和动作分布,来平滑连接底层策略。训练过渡策略具有挑战性,因为自然奖励信号——下一策略能否成功执行其子任务——是稀疏的。通过对抗逆强化学习训练过渡策略以匹配期望状态和动作的分布,我们避免依赖基于任务的奖励。为进一步提升性能,我们使用具有二元动作空间的深度 Q 学习来确定何时从过渡策略切换到下一个预训练策略,以上一子任务的成功或失败作为奖励。尽管奖励仍然稀疏,但由于简单的二元动作空间,问题不那么严重。我们在需要多样技能的连续双足 locomotion 和手臂操纵任务上演示了我们的方法。我们表明它平滑连接底层策略,实现了比先前基于奖励函数搜索成功轨迹但不匹配状态分布的方法更高的成功率。
引用
@article{arxiv.2110.04357,
title = {Training Transition Policies via Distribution Matching for Complex Tasks},
author = {Ju-Seung Byun and Andrew Perrault},
journal= {arXiv preprint arXiv:2110.04357},
year = {2022}
}