中文

通过密度估计的多策略评估

机器学习 2026-01-13 v3 人工智能

摘要

我们研究多策略评估问题,其中给定一组KK个策略,目标是评估它们的性能(固定时间范围内的期望总奖励),精度为ϵ\epsilon,概率至少为1δ1-\delta。我们提出了一种名为CAESAR\mathrm{CAESAR}的算法。我们的方法基于计算近似最优离线采样分布,并使用从中采样的数据同时估计策略值。CAESAR\mathrm{CAESAR}有两个阶段。在第一阶段,我们以低阶样本复杂度(与O~(1ϵ)\tilde{O}(\frac{1}{\epsilon})成比例)生成目标策略访问分布的粗略估计。在第二阶段,我们通过最小化由DualDICE \cite{nachum2019dualdice}目标启发的逐步二次损失函数来近似最优离线采样分布并计算所有目标策略的重要性加权比率。忽略低阶和对数项,CAESAR\mathrm{CAESAR}的样本复杂度为O~(H4ϵ2h=1Hmaxk[K]s,a(dhπk(s,a))2μh(s,a))\tilde{O}\left(\frac{H^4}{\epsilon^2}\sum_{h=1}^H\max_{k\in[K]}\sum_{s,a}\frac{(d_h^{\pi^k}(s,a))^2}{\mu^*_h(s,a)}\right),其中dπd^{\pi}是策略π\pi的访问分布,μ\mu^*是最优采样分布,HH是时间范围。

关键词

引用

@article{arxiv.2404.00195,
  title  = {Multiple-policy Evaluation via Density Estimation},
  author = {Yilei Chen and Aldo Pacchiano and Ioannis Ch. Paschalidis},
  journal= {arXiv preprint arXiv:2404.00195},
  year   = {2026}
}

备注

ICML 2025