中文

异构数据下的强化学习:估计与推断

机器学习 2022-02-02 v1 统计方法学

摘要

强化学习(RL)有望为医疗、教育、商业及其他领域中的广泛决策问题提供数据驱动支持。经典 RL 方法关注总回报的均值,因此在大规模数据集下常见异质群体的设定中可能产生误导性结果。我们引入 K-异质马尔可夫决策过程(K-Hetero MDP)以处理具有群体异质性的序贯决策问题。我们提出自动聚类策略评估(ACPE)用于估计给定策略的值,以及自动聚类策略迭代(ACPI)用于估计给定策略类中的最优策略。我们的自动聚类算法可在估计每个子群体的 Q 函数与最优策略的同时,自动检测并识别同质子群体。我们建立了 ACPE 与 ACPI 所得估计量的收敛速率并构造了置信区间。我们给出仿真以支持理论发现,并在标准 MIMIC-III 数据集上进行了实证研究。后者分析显示了价值异质性的证据并证实了我们所提新方法的优势。

关键词

引用

@article{arxiv.2202.00088,
  title  = {Reinforcement Learning with Heterogeneous Data: Estimation and Inference},
  author = {Elynn Y. Chen and Rui Song and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2202.00088},
  year   = {2022}
}