关卡采样过程如何影响深度强化学习中的零样本泛化
机器学习
2023-12-12 v2 人工智能
摘要
通过深度强化学习(RL)训练的自主智能体在更广泛应用中面临的一个关键限制是它们泛化到新环境的能力有限,即使这些环境与训练期间遇到的环境具有相似特征。在这项工作中,我们研究了个体环境实例(或关卡)的非均匀采样策略如何影响 RL 智能体的零样本泛化(ZSG)能力,考虑了两种失败模式:过拟合与过度泛化。作为第一步,我们度量了智能体内部表示与训练关卡集合之间的互信息(MI),发现其与实例过拟合具有良好的相关性。与均匀采样相比,基于价值损失优先采样关卡的 adaptive sampling 策略在维持较低 MI 方面更为有效,这为该类技术提供了一种新颖的理论依据。随后我们将注意力转向无监督环境设计(UED)方法,该方法自适应生成新的训练关卡,并且比从固定集合中采样的方法更有效地最小化 MI。然而,我们发现 UED 方法显著偏移了训练分布,导致在感兴趣分布上的过度泛化以及更差的 ZSG 性能。为防止实例过拟合与过度泛化,我们引入了自监督环境设计(SSED)。SSED 使用变分自编码器生成关卡,在有效降低 MI 的同时最小化与感兴趣分布的偏移,并在 ZSG 上相对于固定集合关卡采样策略与 UED 方法取得了统计显著的改进。
引用
@article{arxiv.2310.03494,
title = {How the level sampling process impacts zero-shot generalisation in deep reinforcement learning},
author = {Samuel Garcin and James Doran and Shangmin Guo and Christopher G. Lucas and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2310.03494},
year = {2023}
}
备注
Currently under review, 9 pages