可调映射规范下的符号指令灵活策略强化学习
机器人学
2025-02-03 v1
摘要
符号任务表示是编码人类指令和领域知识的强大工具。此类指令通过强化学习(RL)引导机器人完成多样化目标并满足约束。大多数现有方法基于环境状态到符号的固定映射。然而,在检查任务中,设备条件需从多个角度评估以避免遗漏错误,机器人必须从不同状态下满足相同的符号。为帮助机器人应对灵活的符号映射,我们提出在RL策略中将符号及其映射规范分别表示。该方法要求RL策略学习符号指令与映射规范的组合, necessitating an efficient learning framework。为应对此问题,我们引入一种称为符号指令与可调映射规范(Symbolic Instructions with Adjustable Mapping Specifications, SIAMS)的灵活策略学习方法。本文使用线性时序逻辑(LTL)表示符号指令,该形式语言易于集成到RL中。我们的方法通过 (1) 规范感知状态调制,将映射规范差异嵌入状态特征,以及 (2) 符号-数量基于任务课程计划,逐步提供任务以适应学习进度来解决指令的多样化完成模式。在3D仿真环境中进行评估,采用离散和连续动作空间,实验结果表明,我们的方法在上下文感知多任务RL比较中性能优于后者。
引用
@article{arxiv.2501.18848,
title = {Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications},
author = {Wataru Hatanaka and Ryota Yamashina and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2501.18848},
year = {2025}
}
备注
8 pages, Accepted by IEEE Robotics and Automation Letters (RA-L)