中文

多奖励多策略评估的自适应探索

机器学习 2025-08-19 v3 人工智能 机器学习

摘要

我们研究了在线多奖励多策略折扣设定下的策略评估问题,其中必须同时为不同策略评估多个奖励函数。我们采用 (ϵ,δ)(\epsilon,\delta)-PAC 视角,以高置信度在有限或凸奖励集上获得 ϵ\epsilon-精确估计,这一设定在文献中尚未被研究。基于先前在多奖励最佳策略识别方面的工作,我们调整了 MR-NaS 探索方案,以联合最小化在不同奖励集上评估不同策略的样本复杂度。我们的方法利用了一个实例特定的下界,揭示了样本复杂度如何随价值偏差的度量而变化,从而指导了高效探索策略的设计。尽管计算此下界涉及困难的非凸优化,但我们提出了一种适用于有限和凸奖励集的高效凸近似。在表格域中的实验证明了这种自适应探索方案的有效性。

关键词

引用

@article{arxiv.2502.02516,
  title  = {Adaptive Exploration for Multi-Reward Multi-Policy Evaluation},
  author = {Alessio Russo and Aldo Pacchiano},
  journal= {arXiv preprint arXiv:2502.02516},
  year   = {2025}
}

备注

Accepted at the International Conference on Machine Learning, 2025