XQCfD: 利用先验数据与先验策略加速快速 Actor-Critic 算法
机器学习
2026-05-12 v1
摘要
在现实世界的在线探索中,强化学习代价高昂。机器人强化学习中常见的做法是纳入额外数据以提高样本效率。专家示范数据对于解决稀疏奖励下的困难探索任务至关重要。虽然先验数据被用于增强经验并预训练模型,但我们指出现有算法未能有效利用预训练策略,导致无法实现可能的样本效率。我们提出 XQCfD,该方法扩展了样本高效的 XQC actor-critic,以集成演示学习、增强回放缓冲区和针对性设计的 stationary policy 架构,旨在避免快速遗忘先验策略。我们表明,stationary 网络架构由于更高的熵预测,能够实现更好的 out-of-distribution 策略改进。XQCfD 在来自 Adroit Robomimic 和 MimicGen 等热门基准的复杂操作任务中实现了最前沿性能,尤其在低更新-数据比率和无集体网络的情况下表现突出。
关键词
引用
@article{arxiv.2605.10734,
title = {XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies},
author = {Daniel Palenicek and Florian Vogt and Joe Watson and Ingmar Posner and Danica Kragic and Jan Peters},
journal= {arXiv preprint arXiv:2605.10734},
year = {2026}
}
备注
22 pages, 10 figures, 2 tables