贝叶斯停止时间问题逆强化学习的充要条件
机器学习
2023-03-29 v6 系统与控制
理论经济学
系统与控制
机器学习
摘要
本文提出一种针对贝叶斯停止时间问题的逆强化学习(IRL)框架。通过观察贝叶斯决策者的动作,我们给出了识别这些动作是否与优化代价函数一致的充要条件。在贝叶斯(部分观测)设定下,逆学习者至多能识别相对于所观测策略的最优性。我们的 IRL 算法识别最优性,然后构造代价函数的集值估计。为实现此 IRL 目标,我们运用了源自微观经济学的贝叶斯显示偏好新思路。我们利用两个重要的停止时间问题实例,即序贯假设检验与贝叶斯搜索,来说明所提 IRL 方案。作为一个真实世界示例,我们使用包含 190000 个视频元数据的 YouTube 数据集,说明所提 IRL 方法如何以高精度预测在线多媒体平台中的用户参与度。最后,针对有限数据集,我们提出一种 IRL 检测算法,并给出其错误概率的有限样本界。
引用
@article{arxiv.2007.03481,
title = {Necessary and Sufficient Conditions for Inverse Reinforcement Learning of Bayesian Stopping Time Problems},
author = {Kunal Pattanayak and Vikram Krishnamurthy},
journal= {arXiv preprint arXiv:2007.03481},
year = {2023}
}