MAD-TD:模型增强数据稳定高更新比率强化学习
机器学习
2025-04-04 v2
摘要
构建能够以少量样本找到良好策略的深度强化学习(RL)智能体一直备受挑战。为实现样本效率,近期研究探索了对每个新样本进行大量梯度步骤的神经网络更新。虽然这种高更新-数据比率(UTD)显示出强大的实证性能,但也引入了训练过程的不稳定性。以往方法需要依赖周期性神经网络参数重置来解决不稳定性,但在许多实际应用中重启训练过程是不可行的,且需要调节重置间隔。本文聚焦于受限样本下稳定训练的核心难题:已学习价值函数无法泛化到未观察到的策略动作。我们直接通过向 off-policy RL 训练过程增添少量来自已学习世界模型生成的数据来缓解此问题。我们的方法称为模型增强 TD 学习(MAD-TD),利用少量生成数据稳定高 UTD 训练,在 DeepMind 控制套件最具挑战性的任务上实现竞争性能。我们的实验进一步凸显了采用优质模型生成数据的重要性、MAD-TD 克服价值高估的能力,以及其在持续学习中的实际稳定性收益。
引用
@article{arxiv.2410.08896,
title = {MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL},
author = {Claas A Voelcker and Marcel Hussing and Eric Eaton and Amir-massoud Farahmand and Igor Gilitschenski},
journal= {arXiv preprint arXiv:2410.08896},
year = {2025}
}