价值函数空间:面向长时序推理的以技能为中心的状态抽象
机器学习
2022-03-31 v2 人工智能
机器人学
摘要
强化学习能够训练出可有效执行复杂任务策略。然而对于长时序任务,这些方法的性能随时序长度下降,往往需要对低层技能进行推理与串联。分层强化学习旨在通过提供一组作为动作抽象的低层技能库来实现这一点。分层方法进一步可通过抽象状态空间来改善这一点。我们认为,合适的状态抽象应取决于可用低层策略的能力。我们提出价值函数空间(Value Function Spaces):一种利用对应于每个低层技能的价值函数生成此类表示的简单方法。这些价值函数捕捉了场景的可供性,从而形成一种紧凑地抽象任务相关信息并鲁棒地忽略干扰项的表示。针对迷宫求解与机器人操作任务的实证评估表明,与替代的无模型与基于模型方法相比,我们的方法提升了长时序性能并实现了更好的零样本泛化。
引用
@article{arxiv.2111.03189,
title = {Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning},
author = {Dhruv Shah and Peng Xu and Yao Lu and Ted Xiao and Alexander Toshev and Sergey Levine and Brian Ichter},
journal= {arXiv preprint arXiv:2111.03189},
year = {2022}
}
备注
Accepted to ICLR 2022