中文

基于决策-RWKV的机器人操作优化:一种用于终身学习的循环序列建模方法

机器人学 2024-07-24 v1

摘要

基于Transformer架构的模型在自然语言处理、计算机视觉和机器人学等领域得到了广泛应用,大型语言模型如ChatGPT彻底改变了机器对人类语言的理解方式,并展现出惊人的记忆和再现能力。传统机器学习算法在灾难性遗忘方面受限,这对机器人部署所需的多样化和通用能力构成了负面影响。本文探讨了以Receptance Weighted Key Value (RWKV)框架为基础的方法,该框架在高效且有效的序列建模方面具有先进能力,并将其集成到决策转换器和经验回放架构中。本文关注于序列决策和终身机器人学习任务中潜在的性能提升。我们引入了决策-RWKV (DRWKV)模型,并在D4RL数据库中使用OpenAI Gym环境和D'Claw平台上进行大量实验,以评估DRWKV模型在单任务测试和终身学习场景下的性能,展示了其高效处理多个子任务的能力。本研究中所有算法、训练及图像渲染的代码均已开源于https://github.com/ancorasir/DecisionRWKV。

关键词

引用

@article{arxiv.2407.16306,
  title  = {Optimizing Robotic Manipulation with Decision-RWKV: A Recurrent Sequence Modeling Approach for Lifelong Learning},
  author = {Yujian Dong and Tianyu Wu and Chaoyang Song},
  journal= {arXiv preprint arXiv:2407.16306},
  year   = {2024}
}

备注

14 pages, 7 figures, 1 table, submitted to the Special Issue on Large Language Models In Design And Manufacturing in the Journal of Computing and Information Science in Engineering, see https://github.com/ancorasir/DecisionRWKV