中文

贝叶斯停止时间问题逆强化学习的充要条件

机器学习 2023-03-29 v6 系统与控制 理论经济学 系统与控制 机器学习

摘要

本文提出一种针对贝叶斯停止时间问题的逆强化学习(IRL)框架。通过观察贝叶斯决策者的动作,我们给出了识别这些动作是否与优化代价函数一致的充要条件。在贝叶斯(部分观测)设定下,逆学习者至多能识别相对于所观测策略的最优性。我们的 IRL 算法识别最优性,然后构造代价函数的集值估计。为实现此 IRL 目标,我们运用了源自微观经济学的贝叶斯显示偏好新思路。我们利用两个重要的停止时间问题实例,即序贯假设检验与贝叶斯搜索,来说明所提 IRL 方案。作为一个真实世界示例,我们使用包含 190000 个视频元数据的 YouTube 数据集,说明所提 IRL 方法如何以高精度预测在线多媒体平台中的用户参与度。最后,针对有限数据集,我们提出一种 IRL 检测算法,并给出其错误概率的有限样本界。

关键词

引用

@article{arxiv.2007.03481,
  title  = {Necessary and Sufficient Conditions for Inverse Reinforcement Learning of Bayesian Stopping Time Problems},
  author = {Kunal Pattanayak and Vikram Krishnamurthy},
  journal= {arXiv preprint arXiv:2007.03481},
  year   = {2023}
}