中文

基于有界极值寻求的分布迁移下机器人操作的深度强化学习

计算机视觉与模式识别 2026-04-02 v1 人工智能 图像与视频处理

摘要

强化学习在机器人操作中显示出强大的性能,但所学策略在测试条件不同于训练分布时往往会性能下降。这一限制在尤其重要的接触丰富任务中体现明显,如推送和抓取放置,其中目标、接触条件或机器人动力学的变化可能导致系统在推断时脱离分布。在本文中,我们研究一种结合了强化学习和有界极值寻求的混合控制器,以提高此类条件下的鲁棒性。在所提出的方法中,深度确定性策略梯度(DDPG)策略是在标准条件下训练机器人推送和抓取放置任务,然后在部署时与有界极值寻求(ES)结合。RL策略提供快速的操作行为,而有界ES确保整体控制器对操作条件发生变化时的鲁棒性。对所得控制器进行了在几种超出分布的设置下的评估,包括时变目标和空间变化的摩擦片。

关键词

引用

@article{arxiv.2604.01141,
  title  = {Looking into a Pixel by Nonlinear Unmixing -- A Generative Approach},
  author = {Maofeng Tang and Hairong Qi},
  journal= {arXiv preprint arXiv:2604.01141},
  year   = {2026}
}