将沙子变为金子:通过因果界限回收数据桥接 On-Policy 与 Off-Policy 学习
机器学习
2025-10-20 v2 人工智能
摘要
深度强化学习(DRL)在解决各类领域中复杂的决策任务方面表现出色。然而,它们往往需要大量训练步骤和庞大的经验回放缓冲区,导致计算和资源需求巨大。为此,我们引入一种新颖的理论结果,将 Neyman-Rubin 因果潜在结果框架引入 DRL。与大多数关注对反事实损失的方法不同,我们在事实损失上建立因果界限,这类似于 DRL 中的 on-policy 损失。该界限通过存储经验回放缓冲区中过去价值网络输出来计算,有效利用通常被丢弃的数据。实验在 Atari 2600 和 MuJoCo 领域进行,针对各种智能体(如 DQN 和 SAC),实现最高达 383% 的奖励比,超过没有我们提出术语的同一智能体,并将经验回放缓冲区大小降低最高 96%,显著提高样本效率,代价极小。
引用
@article{arxiv.2507.11269,
title = {Turning Sand to Gold: Recycling Data to Bridge On-Policy and Off-Policy Learning via Causal Bound},
author = {Tal Fiskus and Uri Shaham},
journal= {arXiv preprint arXiv:2507.11269},
year = {2025}
}
备注
57 pages, 17 figures