多奖励多策略评估的自适应探索
机器学习
2025-08-19 v3 人工智能
机器学习
摘要
我们研究了在线多奖励多策略折扣设定下的策略评估问题,其中必须同时为不同策略评估多个奖励函数。我们采用 -PAC 视角,以高置信度在有限或凸奖励集上获得 -精确估计,这一设定在文献中尚未被研究。基于先前在多奖励最佳策略识别方面的工作,我们调整了 MR-NaS 探索方案,以联合最小化在不同奖励集上评估不同策略的样本复杂度。我们的方法利用了一个实例特定的下界,揭示了样本复杂度如何随价值偏差的度量而变化,从而指导了高效探索策略的设计。尽管计算此下界涉及困难的非凸优化,但我们提出了一种适用于有限和凸奖励集的高效凸近似。在表格域中的实验证明了这种自适应探索方案的有效性。
引用
@article{arxiv.2502.02516,
title = {Adaptive Exploration for Multi-Reward Multi-Policy Evaluation},
author = {Alessio Russo and Aldo Pacchiano},
journal= {arXiv preprint arXiv:2502.02516},
year = {2025}
}
备注
Accepted at the International Conference on Machine Learning, 2025