中文

XQCfD: 利用先验数据与先验策略加速快速 Actor-Critic 算法

机器学习 2026-05-12 v1

摘要

在现实世界的在线探索中,强化学习代价高昂。机器人强化学习中常见的做法是纳入额外数据以提高样本效率。专家示范数据对于解决稀疏奖励下的困难探索任务至关重要。虽然先验数据被用于增强经验并预训练模型,但我们指出现有算法未能有效利用预训练策略,导致无法实现可能的样本效率。我们提出 XQCfD,该方法扩展了样本高效的 XQC actor-critic,以集成演示学习、增强回放缓冲区和针对性设计的 stationary policy 架构,旨在避免快速遗忘先验策略。我们表明,stationary 网络架构由于更高的熵预测,能够实现更好的 out-of-distribution 策略改进。XQCfD 在来自 Adroit Robomimic 和 MimicGen 等热门基准的复杂操作任务中实现了最前沿性能,尤其在低更新-数据比率和无集体网络的情况下表现突出。

关键词

引用

@article{arxiv.2605.10734,
  title  = {XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies},
  author = {Daniel Palenicek and Florian Vogt and Joe Watson and Ingmar Posner and Danica Kragic and Jan Peters},
  journal= {arXiv preprint arXiv:2605.10734},
  year   = {2026}
}

备注

22 pages, 10 figures, 2 tables