利用离线强化学习中的泛化性通过未见状态增强进行利用
机器学习
2023-09-26 v2 人工智能
机器学习
摘要
离线强化学习(RL)方法通过保守价值估计——惩罚未见状态与动作的价值——在探索与利用之间取得平衡。无模型方法惩罚所有未见动作的价值,而有模型方法能够通过模型展开进一步利用未见状态。然而,此类方法由于两个因素在寻找远离可用离线数据的未见状态方面能力受限——(a)由于级联模型误差导致模型展开视野很短,以及(b)模型展开仅源自离线数据中观测到的状态。我们放宽第二个假设,提出一种新颖的未见状态增强策略,以允许在所学模型与价值估计能够泛化的未见状态处进行利用。我们的策略通过对已见状态进行价值引导扰动来发现未见状态,随后过滤掉认知不确定性估计过高(高误差)或过低(与已见数据过于相似)的状态。我们在若干离线 RL 任务中观察到性能提升,并发现我们的增强策略持续导致整体更低的平均数据集 Q 值估计,即比基线更保守的 Q 值估计。
引用
@article{arxiv.2308.03882,
title = {Exploiting Generalization in Offline Reinforcement Learning via Unseen State Augmentations},
author = {Nirbhay Modhe and Qiaozi Gao and Ashwin Kalyan and Dhruv Batra and Govind Thattai and Gaurav Sukhatme},
journal= {arXiv preprint arXiv:2308.03882},
year = {2023}
}