中文

优化TD3用于七自由度机械臂抓取:通过探索增强对比学习克服次优性

机器人学 2024-08-27 v1 人工智能

摘要

在基于Actor-Critic的强化学习算法(如双延迟深度确定性策略梯度(TD3))中,对空间空间的探索不足可能导致控制七自由度机械臂时产生次优策略。为解决此问题,我们提出了一种新颖的探索增强对比学习(EECL)模块,该模块通过为遇到新状态提供额外奖励来改善探索。我们的模块将先前探索过的状态存储在一个缓冲区中,并通过在K维树(KDTree)框架内使用欧几里得距离与历史数据进行比较来识别新状态。当智能体探索新状态时,会分配探索奖励。这些奖励随后被集成到TD3算法中,确保Q学习过程包含这些信号,从而促进更有效的策略优化。我们在robosuite panda提升任务上评估了我们的方法,结果表明,在测试环境中,它在效率和收敛速度方面均显著优于基线TD3。

关键词

引用

@article{arxiv.2408.14009,
  title  = {Optimizing TD3 for 7-DOF Robotic Arm Grasping: Overcoming Suboptimality with Exploration-Enhanced Contrastive Learning},
  author = {Wen-Han Hsieh and Jen-Yuan Chang},
  journal= {arXiv preprint arXiv:2408.14009},
  year   = {2024}
}

备注

4 pages, 2 figures, IEEE-ICKII-2024