不确定事件检测器下带 LTL 指令的动作与查询策略强化学习
机器人学
2023-09-07 v1
摘要
带有线性时序逻辑(LTL)目标的强化学习(RL)可使机器人在未知环境中执行符号事件计划。大多数现有方法假设事件检测器能准确地将环境状态映射为符号事件;然而,现实世界的事件检测器不可避免地存在不确定性。事件检测器中的此类不确定性会在 LTL 指令上产生多种分支可能,从而混淆动作决策。此外,对不确定事件检测器(任务推进所必需)的查询可能进一步增加不确定性。为应对这些问题,我们提出一种 RL 框架——基于信念 LTL 的动作与查询学习(LAQBL),以学习一个智能体,其能考虑因不确定事件检测导致的 LTL 指令多样性,同时避免因不必要的事件检测查询而致使任务失败。我们的框架同时学习 1)信念 LTL 的嵌入,即利用图神经网络对 LTL 指令上的多种分支可能进行编码;2)动作策略;3)决定是否查询事件检测器的查询策略。在 2D 网格世界与图像输入机器人巡检环境中的仿真表明,即便存在不确定事件检测器,我们的方法也能成功学习遵循 LTL 指令的动作。
引用
@article{arxiv.2309.02722,
title = {Reinforcement Learning of Action and Query Policies with LTL Instructions under Uncertain Event Detector},
author = {Wataru Hatanaka and Ryota Yamashina and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2309.02722},
year = {2023}
}
备注
8 pages, Accepted by Robotics and Automation Letters (RA-L)