中文

D-SPEAR: 双流优先经验自适应回放用于机器人操作中稳定的强化学习

机器人学 2026-04-03 v2 人工智能 机器学习

摘要

机器人操作对强化学习而言仍然具有挑战性,原因在于其接触丰富的动力学、长时间尺度和训练不稳定性。尽管SAC和TD3等离线策略actor-critic算法在仿真中表现良好,但它们在真实场景中常常遭受策略振荡和性能崩溃,部分原因在于经验回放策略忽略了actor和critic对数据的不同需求。我们提出D-SPEAR:双流优先经验自适应回放——一种解耦actor和critic采样同时保持共享回放缓冲区的回放框架。critic利用优先回放进行高效的价值学习,而actor则使用低误差转换进行更新以稳定策略优化。自适应锚定机制基于TD误差的变异系数在均匀采样和优先采样之间进行平衡,基于Huber的critic目标函数进一步提升了在异质奖励尺度下的鲁棒性。我们在robosuite基准测试中的具有挑战性的机器人操作任务(包括Block-Lifting和Door-Opening)上评估了D-SPEAR。结果表明,D-SPEAR在最终性能和训练稳定性方面始终优于SAC、TD3和DDPG等强离线策略基线方法,消融研究证实了actor端和critic端回放流的互补作用。

关键词

引用

@article{arxiv.2603.27346,
  title  = {D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation},
  author = {Yu Zhang and Karl Mason},
  journal= {arXiv preprint arXiv:2603.27346},
  year   = {2026}
}

备注

Accepted at IEEE 11th International Conference on Control and Robotics Engineering (ICCRE 2026)