TraKDis:一种用于视觉强化学习的基于 Transformer 的知识蒸馏方法及其在布料操作中的应用
机器人学
2024-01-25 v1
摘要
利用基于视觉反馈的强化学习来实现机器人布料操作具有吸引力,因为可以同时学习机器人感知与控制。然而,由于布料复杂的动力学特性和相应状态的高维性,带来了重大挑战,掩盖了该想法的实用性。为了解决这些问题,我们提出了 TraKDis,一种新颖的基于 Transformer 的知识蒸馏方法,将视觉强化学习问题分解为两个不同的阶段。第一阶段训练一个特权智能体,其拥有布料状态信息的完整知识。该特权智能体作为教师,为后续阶段提供有价值的指导和训练信号。第二阶段涉及知识蒸馏过程,通过利用预训练的状态估计和权重初始化,将特权智能体获取的知识迁移到基于视觉的智能体。与最先进的 RL 技术相比,TraKDis 展现出更好的性能,在仿真中的布料折叠任务中分别表现出 21.9%、13.8% 和 8.3% 的更高性能。此外,为了验证鲁棒性,我们在噪声环境中评估了该智能体;结果表明其能够有效处理并适应环境的不确定性。我们还进行了真实机器人实验,以展示我们的方法在真实场景中的效率。
引用
@article{arxiv.2401.13362,
title = {TraKDis: A Transformer-based Knowledge Distillation Approach for Visual Reinforcement Learning with Application to Cloth Manipulation},
author = {Wei Chen and Nicolas Rojas},
journal= {arXiv preprint arXiv:2401.13362},
year = {2024}
}
备注
Accepted for IEEE Robotics and Automation Letters in January 2024