直接求解零样本强化学习损失
机器学习
2025-02-18 v1
摘要
零样本强化学习 (RL) 方法旨在根据奖励函数的描述,在给定环境中即时生成特定 RL 任务的行为。这些方法通常通过评估其在一系列下游任务上的平均性能来进行测试。然而,除非已知下游任务的分布,否则无法直接针对该目标进行训练。现有方法要么使用其他学习准则 [BBQ+ 18, TRO23, TO21, HDB+ 19],要么显式地对下游任务设置先验,例如由随机神经网络给出的奖励函数 [FPAL24]。在此我们证明,对于一系列无信息先验(如白噪声奖励、时间平滑奖励、“散射”稀疏奖励或它们的组合),零样本 RL 损失可以被直接优化。因此,对于广泛的先验混合,算法上学习最优零样本特征是可能的。令人惊讶的是,通过不同的方法,白噪声先验导出了与 VISR [HDB+19] 几乎相同的目标函数。这表明 VISR 中某些看似任意的设定(如 Von Mises--Fisher 分布)确实最大化了下游性能。这也暗示了处理 VISR 目标的更高效方法。最后,我们讨论了零样本 RL 目标的若干推论与局限性,例如在仅使用高斯密集奖励先验时,其倾向于产生狭窄的最优特征。
引用
@article{arxiv.2502.10792,
title = {Tackling the Zero-Shot Reinforcement Learning Loss Directly},
author = {Yann Ollivier},
journal= {arXiv preprint arXiv:2502.10792},
year = {2025}
}