中文

有状态离线上下文策略评估与学习

机器学习 2021-10-20 v1 机器学习

摘要

我们研究一类结构化马尔可夫决策过程中的序列数据离屏策略评估与学习,该类过程源于与具有上下文的外生到达序列的重复交互,这些到达对智能体动作产生未知的个体级响应。该模型可视为带资源约束的上下文bandit的离线推广。我们形式化了诸如动态个性化定价及其他运营管理问题在可能存在高维用户类型时的相关因果结构。关键洞见是:个体级响应通常不受状态变量因果影响,因此可轻易地跨时间步与状态泛化。当此成立时,我们研究(双重稳健)离屏策略评估与学习的含义,转而利用单时间步评估,通过来自总体的数据估计单次到达的期望,用于边际MDP中的拟合值迭代。我们研究了样本复杂度并分析了导致混淆误差随时间持续而非衰减的误差放大。在动态有容量约束定价的仿真中,我们展示了在这类相关问题中改进的样本外策略性能。

关键词

引用

@article{arxiv.2110.10081,
  title  = {Stateful Offline Contextual Policy Evaluation and Learning},
  author = {Nathan Kallus and Angela Zhou},
  journal= {arXiv preprint arXiv:2110.10081},
  year   = {2021}
}