一种用于设计强化学习环境的验证工具
机器学习
2021-12-13 v1 人工智能
摘要
强化学习(RL)随着在多种有影响力应用与产品中的推出,在学术界与科技产业中获得了越来越多的关注。尽管研究在许多方向(例如离线 RL、性能等)积极展开,许多 RL 从业者面临一个被严重忽视的挑战:判定所设计的马尔可夫决策过程(MDP)是否有效且有意义。本研究提出一种基于启发式的特征分析方法,以验证 MDP 是否被正确表述。我们认为适用于应用 RL 的 MDP 应包含一组对动作敏感且在奖励上具有预测性的状态特征。我们在构造的环境中测试了我们的方法,表明该方法能识别某些无效的环境表述。据我们所知,对 RL 问题表述进行有效性分析是一个新颖方向。我们期望我们的工具能作为一个启发性示例,帮助从业者更轻松地将 RL 应用于现实问题。
引用
@article{arxiv.2112.05519,
title = {A Validation Tool for Designing Reinforcement Learning Environments},
author = {Ruiyang Xu and Zhengxing Chen},
journal= {arXiv preprint arXiv:2112.05519},
year = {2021}
}