单状态RMDP的梯度优化
机器学习
2022-09-27 v1
摘要
随着自动驾驶、机器人部件控制以及医疗诊断等现代问题变得愈发难以解析求解,数据驱动的决策制定获得了极大的关注。在问题复杂度维度超出人类理解能力的情况下,数据驱动的解决方案是一个强有力的选择。许多此类方法属于机器学习的一个分支,即强化学习。不幸的是,数据驱动模型常带有在最坏场景下表现如何的不确定性。由于解往往不是解析导出的,这些模型会不可预测地失效。在自动驾驶和医学等领域,此类失效的后果可能是灾难性的。人们正在探索多种方法以解决该问题,其中已知的一种称为对抗学习。它让两个模型相互对抗,使一个模型以其目标与另一模型目标相反的方式进行优化。这类训练有潜力找到在复杂且高 stakes 环境中可靠表现的模型,尽管尚不确定此类训练何时会奏效。目标是深入了解此类模型何时会达到稳定解。
引用
@article{arxiv.2209.12295,
title = {Gradient Optimization for Single-State RMDPs},
author = {Keith Badger},
journal= {arXiv preprint arXiv:2209.12295},
year = {2022}
}
备注
16 pages, 6 figures