中文

面向鲁棒仿真到现实强化学习的双动作策略

机器学习 2024-10-17 v1 人工智能 机器人学

摘要

本文提出双动作策略(Dual Action Policy, DAP),以解决强化学习中仿真到现实差异天然存在的动态不匹配问题。DAP使用单个策略预测两套动作:一套用于在仿真中最大化任务奖励,另一套则专为通过奖励调整实现域适应而设计。这种解耦方式使得在训练阶段能够更容易地在源域内最大化总体奖励。此外,DAP在训练过程中融入基于不确定性的探索,以增强智能体的鲁棒性。实验结果表明,DAP在桥接仿真到现实差距方面有效,能够在仿真中的挑战性任务上超越基线方法,进一步通过引入不确定性估计实现性能提升。

关键词

引用

@article{arxiv.2410.12250,
  title  = {Dual Action Policy for Robust Sim-to-Real Reinforcement Learning},
  author = {Ng Wen Zheng Terence and Chen Jianda},
  journal= {arXiv preprint arXiv:2410.12250},
  year   = {2024}
}