中文

基于新颖性的连续机器人控制样本复用

机器人学 2024-10-18 v1 机器学习

摘要

在强化学习中,代理人通过与环境交互收集状态信息和奖励,这对于策略细化至关重要。这一过程在复杂的机器人仿真和实际应用中尤为耗时。传统算法通常在处理单个样本批次后再与环境重新交互,从而未能充分利用历史数据。然而,频繁观察到的状态(具有可靠的价值估计)所需的更新极少;相比之下,稀疏观察到的状态需要更密集的更新才能实现准确的价值估计。为此,我们提出了基于新颖性的样本复用方法(NSR)。NSR 为稀疏、新颖的状态提供额外的更新,而对频繁的状态则跳过额外的更新,从而在再次与环境交互之前最大化样本的使用。我们的实验表明,NSR 在不显著增加计算时间的前提下,提高了算法的收敛速度和成功率。我们的代码已公开,地址为 https://github.com/ppksigs/NSR-DDPG-HER。

关键词

引用

@article{arxiv.2410.13490,
  title  = {Novelty-based Sample Reuse for Continuous Robotics Control},
  author = {Ke Duan and Kai Yang and Houde Liu and Xueqian Wang},
  journal= {arXiv preprint arXiv:2410.13490},
  year   = {2024}
}