混合环境中的决策:一种模型聚合方法
机器学习
2025-05-02 v2 机器学习
摘要
最近的工作(Foster等人,2021, 2022, 2023b)和Xu与Zeevi(2023)发展了决策估计系数(DEC)框架,用于表征一般在线决策问题的复杂度并提供通用的算法设计原则。然而,这些工作要么聚焦于纯随机场景,即世界随时间保持不变,要么聚焦于纯对抗场景,即世界随时间发生任意变化。在混合场景中,即世界的动态保持不变但奖励发生任意变化时,仅给出决策复杂度的保守界限。本文提出了DEC的一个通用扩展,更精确地表征此情形。除了在特殊情形中的应用外,我们的框架导致一种灵活的算法设计,即学习者在假设集合的子集上学习,以换取决策复杂度与估计复杂度之间的权衡,这可能是独有兴趣。我们的工作涵盖混合场景下的基于模型的学习和无模型学习,提出了对Du等人(2021)提出的双线性类的一个新扩展,用于对抗奖励情形。在此基础上,我们的方法改进了线性Q*/V* MDP在纯随机场景中已知的最佳 regret 界限。
引用
@article{arxiv.2502.05974,
title = {Decision Making in Hybrid Environments: A Model Aggregation Approach},
author = {Haolin Liu and Chen-Yu Wei and Julian Zimmert},
journal= {arXiv preprint arXiv:2502.05974},
year = {2025}
}