解耦基于图像的强化学习中的识别遗憾与决策遗憾
机器学习
2025-04-04 v2
摘要
在基于图像的强化学习(RL)中,策略通常分两步执行:首先从原始图像中提取低维特征(“识别”步骤),然后基于提取的特征采取行动(“决策”步骤)。提取与性能虚假相关或与决策无关的特征会导致泛化性能不佳,这在基于图像的 RL 中被称为观测过拟合。在这种情况下,很难量化多少误差可归因于糟糕的特征提取,多少误差可归因于糟糕的决策。为了解耦这两种误差来源,我们引入了识别遗憾和决策遗憾的概念。利用这些概念,我们表征并区分了观测过拟合背后的两种不同原因:过度特化的表示(包含最优决策所不需要的特征,导致高决策遗憾)与欠特化的表示(仅包含在训练期间与性能虚假相关的有限特征集,导致高识别遗憾)。最后,我们在迷宫环境和 Atari 游戏 Pong 中提供了由于过度特化和欠特化表示导致观测过拟合的说明性示例。
引用
@article{arxiv.2409.13108,
title = {Disentangling Recognition and Decision Regrets in Image-Based Reinforcement Learning},
author = {Alihan Hüyük and Arndt Ryo Koblitz and Atefeh Mohajeri and Matthew Andrews},
journal= {arXiv preprint arXiv:2409.13108},
year = {2025}
}