异构数据下的强化学习:估计与推断
机器学习
2022-02-02 v1 统计方法学
摘要
强化学习(RL)有望为医疗、教育、商业及其他领域中的广泛决策问题提供数据驱动支持。经典 RL 方法关注总回报的均值,因此在大规模数据集下常见异质群体的设定中可能产生误导性结果。我们引入 K-异质马尔可夫决策过程(K-Hetero MDP)以处理具有群体异质性的序贯决策问题。我们提出自动聚类策略评估(ACPE)用于估计给定策略的值,以及自动聚类策略迭代(ACPI)用于估计给定策略类中的最优策略。我们的自动聚类算法可在估计每个子群体的 Q 函数与最优策略的同时,自动检测并识别同质子群体。我们建立了 ACPE 与 ACPI 所得估计量的收敛速率并构造了置信区间。我们给出仿真以支持理论发现,并在标准 MIMIC-III 数据集上进行了实证研究。后者分析显示了价值异质性的证据并证实了我们所提新方法的优势。
引用
@article{arxiv.2202.00088,
title = {Reinforcement Learning with Heterogeneous Data: Estimation and Inference},
author = {Elynn Y. Chen and Rui Song and Michael I. Jordan},
journal= {arXiv preprint arXiv:2202.00088},
year = {2022}
}