利用强化学习技术实现策略的有效采纳与验证
机器学习
2019-06-25 v1 人工智能
摘要
不同形式的奖励与惩罚普遍存在,并出现于广泛的决策场景中。通过观察足够数量的重复试验的结果,人们会逐渐学习到特定策略或方法的价值与用处。然而,在给定环境中,不同试验产生的结果受随机影响与波动。在学习给定策略的用处时,系统性地进行顺序试验涉及显著成本;因此,在大多数学习情境中,人们希望通过采用学习停止规则将成本控制在界限内。本文中,我们考察了在不同学习环境中部署不同停止策略的情况,这些环境从任务关键型操作的高度严格到非任务关键型操作的高度宽容不等,且重点放在前者并特别应用于航空安全。在策略评估中,识别出两个顺序学习阶段,我们使用概率模型描述结果变异,并给出了关键性能度量指标的闭式表达式。还制定了将试验观测映射到策略选择的决策规则。此外,进行了仿真实验,印证了理论结果的有效性。
引用
@article{arxiv.1906.09340,
title = {Leveraging Reinforcement Learning Techniques for Effective Policy Adoption and Validation},
author = {Nikki Lijing Kuang and Clement H. C. Leung},
journal= {arXiv preprint arXiv:1906.09340},
year = {2019}
}
备注
12 pages; ICCSA 2019