在稀疏奖励强化学习中利用Transformer实现可解释时序逻辑运动规划
机器人学
2023-07-18 v2 人工智能
计算机科学中的逻辑
摘要
基于自动机的方法已使机器人能够执行各种复杂任务。然而,大多数现有基于自动机的算法高度依赖对所考虑任务状态的手动定制表示,限制了其在深度强化学习算法中的适用性。为解决这个问题,通过将Transformer融入强化学习,我们开发了双Transformer引导的时序逻辑框架(T2TL),该框架两次利用Transformer的结构特征,即首先通过Transformer模块编码LTL指令以在训练期间高效理解任务指令,然后再次通过Transformer编码上下文变量以提升任务性能。特别地,LTL指令由co-safe LTL指定。作为一种保语义的重写操作,LTL progression被用于将有复杂任务分解为可学习的子目标,这不仅将非马尔可夫奖励决策过程转换为马尔可夫过程,还通过多子任务同步学习提高采样效率。进一步引入与环境无关的LTL预训练方案以促进Transformer模块的学习,从而改进LTL的表示。仿真结果证明了T2TL框架的有效性。
引用
@article{arxiv.2209.13220,
title = {Exploiting Transformer in Sparse Reward Reinforcement Learning for Interpretable Temporal Logic Motion Planning},
author = {Hao Zhang and Hao Wang and Zhen Kan},
journal= {arXiv preprint arXiv:2209.13220},
year = {2023}
}
备注
IEEE Robotics and Automation Letters