强化学习的合成监控环境
机器学习
2026-03-09 v1 机器学习
摘要
强化学习(RL)缺乏能够对智能体行为进行精确白盒诊断的基准。当前环境通常纠缠复杂因素且缺乏真实最优指标,使得难以隔离算法失败的原因。我们引入了合成监控环境(SMEs),一个连续控制任务的无限套件。SMEs 提供完全可配置的任务特征和已知的最优策略。因此,SMEs 允许精确计算瞬时遗憾。其严格的几何状态空间边界允许系统地进行分布内(WD)和分布外(OOD)评估。我们通过 PPO、TD3 和 SAC 的多维消融实验展示了该框架的优势,揭示了特定的环境属性——如动作或状态空间大小、奖励稀疏性和最优策略的复杂性——如何影响 WD 和 OOD 性能。我们从而表明 SMEs 提供了一个标准化的透明测试床,将 RL 评估从经验基准转向严格的科学分析。
引用
@article{arxiv.2603.06252,
title = {Synthetic Monitoring Environments for Reinforcement Learning},
author = {Leonard Pleiss and Carolin Schmidt and Maximilian Schiffer},
journal= {arXiv preprint arXiv:2603.06252},
year = {2026}
}