中文

随机丢帧下的决策Transformer

机器学习 2023-03-08 v1 人工智能 机器人学

摘要

在现实世界中利用深度强化学习(DRL)远程控制智能体尚待实现。一个关键的垫脚石是设计在受损通信或传感器故障导致信息丢失时仍具鲁棒性的强化学习算法。典型的强化学习方法通常需要大量在线交互数据,而在现实世界中收集这些数据成本高且不安全。此外,当应用于丢帧场景时,即便丢帧率适中,它们表现也不尽如人意。为解决这些问题,我们提出了随机丢帧下的决策Transformer(DeFog),一种离线强化学习算法,使智能体无需在线交互即可在丢帧场景中稳健行动。DeFog首先随机掩码离线数据集中的数据,并显式地将丢帧的时间跨度作为输入。之后,在相同离线数据集上以更高掩码率进行微调阶段会进一步提升性能。实证结果表明,在90%等极端丢帧率下,DeFog优于强基线方法,同时在常规MuJoCo控制基准和Atari环境中无丢帧条件下保持相近的回报。我们的方法为在数据有限或不可靠的现实世界环境中控制智能体提供了一种鲁棒且可部署的解决方案。

关键词

引用

@article{arxiv.2303.03391,
  title  = {Decision Transformer under Random Frame Dropping},
  author = {Kaizhe Hu and Ray Chen Zheng and Yang Gao and Huazhe Xu},
  journal= {arXiv preprint arXiv:2303.03391},
  year   = {2023}
}

备注

20 pages, 17 figures; accepted to ICLR 2023