中文

$\Delta$-OPE:基于策略对的无策略估计

机器学习 2024-09-17 v2 信息检索

摘要

无策略范式将推荐任务转化为反事实决策任务,允许使用离线数据对线上指标进行无偏估计,从而实现有效的评估指标以及直接优化线上成功的学习程序。然而,由于无偏性带来的高方差,通常是实际应用中的主要难题。一个重要洞察是,如果两个策略之间具有正协方差,其策略价值差异往往可以以显著降低的方差来估计。这使我们能够构建一个两两无策略估计任务:Δ\Delta-OPE。Δ\Delta-OPE 包含了使用由随机 logging 策略收集的数据来估计所学习策略相对于生产策略改进的常见用例。我们引入基于广泛使用的逆倾向评分估计器及其延伸方法的 Δ\Delta-OPE 方法。此外,我们描述了一种方差最优的可加控制变量,以进一步提升效率。仿真、离线和在线实验表明,我们的方法在评估和学习任务中显著提升了性能。

关键词

引用

@article{arxiv.2405.10024,
  title  = {$\Delta\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies},
  author = {Olivier Jeunen and Aleksei Ustimenko},
  journal= {arXiv preprint arXiv:2405.10024},
  year   = {2024}
}

备注

Accepted as a short paper in the 2024 ACM Conference on Recommender Systems (RecSys '24)