基于手指特定多智能体影子奖励的稳定内手操控
机器人学
2023-09-15 v1
摘要
深度强化学习已展现出解决多指灵巧内手操控任务中高自由度控制及与物体复杂交互的能力。当前DRL方法倾向于使用稀疏奖励而非稠密奖励以便于训练,但缺乏操控过程中的行为约束,导致策略激进且不稳定,不足以满足安全关键的内手操控任务。稠密奖励可通过连续奖励约束规范策略学习稳定操控行为,但难以凭经验定义且最优收敛慢。本工作提出手指特定多智能体影子奖励(FMSR)方法,基于状态-动作占用测度以稠密奖励形式确定稳定操控约束,该测度是DRL的通用效用,在学习过程中被近似。相邻智能体间的信息共享(IS)实现共识训练以加速收敛。方法在Shadow Hand上的两个内手操控任务中评估。结果表明FMSR+IS训练收敛更快,比常规稠密奖励取得更高任务成功率和更好操控稳定性。对比表明,即便有行为约束,FMSR+IS仍取得可比成功率,但比稀疏奖励训练的策略操控稳定性好得多。
引用
@article{arxiv.2309.07349,
title = {Stable In-hand Manipulation with Finger Specific Multi-agent Shadow Reward},
author = {Lingfeng Tao and Jiucai Zhang and Xiaoli Zhang},
journal= {arXiv preprint arXiv:2309.07349},
year = {2023}
}