从受扰离线数据中自动奖励引导
人工智能
2025-09-10 v2 机器学习
摘要
人工智能的关键任务是学习有效的策略,以控制未知环境中的智能体以优化性能度量。离线策略学习方法,如Q学习,允许基于过往经验做出最优决策。本文研究从复杂高维域中的偏态数据进行离线策略学习,其中\emph{未观测混淆}无法先验排除。基于经典深度Q网络(DQN)的基础,我们提出一种对观察数据中混淆偏差鲁棒的新型深度强化学习算法。具体而言,我们的算法试图寻找与观察兼容的最坏情况环境下的安全策略。我们将该方法应用于十二个受扰Atari游戏,发现它在观察输入至行为策略和目标策略不匹配且存在未观测混淆因子的所有游戏中均稳居标准DQN之上。
引用
@article{arxiv.2505.11478,
title = {Automatic Reward Shaping from Confounded Offline Data},
author = {Mingxuan Li and Junzhe Zhang and Elias Bareinboim},
journal= {arXiv preprint arXiv:2505.11478},
year = {2025}
}
备注
ICML 2025