面向强化学习的自适应对称奖励加噪
机器学习
2019-05-27 v1 人工智能
机器学习
摘要
近期强化学习算法虽在各领域取得令人瞩目成果,却受困于脆弱的训练效应,如结果回归及对初始化与参数的高敏感性。我们主张部分脆弱性源于方差差异,即当不同环境区域——状态及/或动作——具有不同奖励方差时所致。这引发两方面问题:其一,Q-learning 等算法中的“无聊区域陷阱”,区域间移动依赖于当前区域方差,且因低方差难以脱离无聊区域;其二,“操纵型顾问”问题,DQN 与 Actor-Critic 算法中使用的价值估计函数引导智能体偏好无聊区域,而不顾均值奖励回报,因其最大化估计精度而非奖励。这为探索如何助力训练提供了新视角,因其同时缓解上述两挑战。人类认知实验显示,加噪奖励信号或可悖论式提升表现。我们借前述两问题解释此现象,主张人类与算法或面临相似挑战。受该结果启发,我们提出自适应对称奖励加噪(ASRN),即依据状态估计方差为奖励添加高斯噪声,从而在不影响环境均值奖励行为的同时规避两问题。我们在具方差差异的多臂老虎机问题中开展实验,证明 Q-learning 算法在该问题中呈现脆弱性效应,且 ASRN 方案可大幅改善结果。我们展示 ASRN 助 DQN 算法在基于 AirSim 驾驶模拟器的端到端自动驾驶任务中训练取得更优结果。
引用
@article{arxiv.1905.10144,
title = {Adaptive Symmetric Reward Noising for Reinforcement Learning},
author = {Refael Vivanti and Talya D. Sohlberg-Baris and Shlomo Cohen and Orna Cohen},
journal= {arXiv preprint arXiv:1905.10144},
year = {2019}
}
备注
9 pages, 7 figures, conference