具有零约束违反的凹效用强化学习
机器学习
2023-11-20 v3 人工智能
摘要
我们考虑具有凸约束的表格无限 horizon 凹效用强化学习(CURL)问题。为此,我们提出一种基于模型的学习算法,该算法也实现了零约束违反。假设凹目标和凸约束在可行占据测度集合内部有解,我们求解一个更紧的优化问题,以确保尽管存在不精确的模型知识和模型随机性,约束也绝不被违反。我们对表格无限 horizon 设置使用基于贝尔曼误差的分析,从而可以分析随机策略。结合基于贝尔曼误差的分析与更紧的优化方程,对于与环境的 次交互,我们获得了目标的高概率后悔保证,其增长为 (不含其他因子)。所提方法可应用于乐观算法以获得高概率后悔界,也可用于后验采样算法以获得宽松的贝叶斯后悔界,但在计算复杂度上有显著改进。
引用
@article{arxiv.2109.05439,
title = {Concave Utility Reinforcement Learning with Zero-Constraint Violations},
author = {Mridul Agarwal and Qinbo Bai and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2109.05439},
year = {2023}
}
备注
Transactions on Machine Learning Research, Dec 2022