室内训练效应:转移函数分布偏移带来的意外增益
机器学习
2025-01-09 v2 人工智能
摘要
在纯净的室内环境还是嘈杂的室外环境进行网球训练更好?为了对这个问题建模,我们在此研究强化学习问题中,训练环境与测试环境之间转移概率的偏移是否会在特定条件下带来更好的性能。我们从一个给定的 MDP 出发,通过向转移函数中添加可量化的参数化噪声,生成新的马尔可夫决策过程(MDP)。我们将此过程称为噪声注入,并将生成的环境称为 -环境。该过程允许我们创建同一环境的变体,并对噪声进行定量控制,以此作为环境之间距离的度量。传统观点认为,在相同的 MDP 上进行训练和测试应该产生最佳结果。形成鲜明对比的是,我们观察到,与在相同的 -环境上进行训练和测试相比,智能体在无噪声环境上训练并在有噪声的 -环境上测试时表现更好。我们证实这一发现超越了噪声变化的范畴:在包括 PacMan 中幽灵行为变化和 Pong 中挡板行为变化在内的 ATARI 游戏变体中,也有可能展示相同的现象。我们在 60 种不同的 ATARI 游戏变体(包括 PacMan、Pong 和 Breakout)中展示了这种有趣的行为。我们将这种现象称为室内训练效应。用于复现我们实验和实现噪声注入的代码可在 https://bit.ly/3X6CTYk 找到。
引用
@article{arxiv.2401.15856,
title = {The Indoor-Training Effect: unexpected gains from distribution shifts in the transition function},
author = {Serena Bono and Spandan Madan and Ishaan Grover and Mao Yasueda and Cynthia Breazeal and Hanspeter Pfister and Gabriel Kreiman},
journal= {arXiv preprint arXiv:2401.15856},
year = {2025}
}