通过自适应组合选项序列:初步结果
机器人学
2024-09-13 v1
摘要
在真实世界环境中进行机器人操控通常需要使机器人的行为适应当前情况,例如通过改变策略执行的序列以完成目标任务。然而问题在于,我们展示了组合由五个深度强化学习选项构成的新序列来执行拾取与放置任务,即使它们的 initiation 和 termination 条件对齐,也不太可能成功完成。我们提出了一个框架以先验地确定序列是否会成功,并研究了三种方法,以在序列无法成功时自适应选项使其顺利衔接。关键在于,我们的自适应方法考虑了选项训练起始点或终止点的实际子集:(1)训练第二个选项从第一个选项结束的地方开始;(2)训练第一个选项到达第二个选项起始点的质心;(3)训练第一个选项到达第二个选项起始点的中位数。结果表明,我们的框架和自适应方法在自适应选项以在全新序列中工作方面具有前景。
引用
@article{arxiv.2409.08195,
title = {Composing Option Sequences by Adaptation: Initial Results},
author = {Charles A. Meehan and Paul Rademacher and Mark Roberts and Laura M. Hiatt},
journal= {arXiv preprint arXiv:2409.08195},
year = {2024}
}