离线决策的快速收敛理论
机器学习
2024-12-04 v2 机器学习
摘要
本文提出了在一般函数逼近下离线决策问题的首个通用快速收敛结果,其中离线强化学习和离线策略评估作为特例。为统一不同设定,我们引入了一个称为“离线反馈决策”的框架,该框架涵盖了广泛的离线决策问题。在此框架内,我们提出了一种简单而强大的算法——经验散度决策,其上界可称为经验离线估计系数。我们证明EOEC是实例依赖的,并且实际上衡量了问题的相关性。当假设数据集具有部分覆盖时,EOEC将以的速率下降(为数据集大小),从而赋予EDD快速收敛保证。最后,我们在DMOF框架中补充了上述结果的下界,进一步证明了我们理论的合理性。
引用
@article{arxiv.2406.01378,
title = {A Fast Convergence Theory for Offline Decision Making},
author = {Chenjie Mao and Qiaosheng Zhang},
journal= {arXiv preprint arXiv:2406.01378},
year = {2024}
}