通过优化抽象进行 Slate Bandit 策略的离策略评估
机器学习
2024-02-20 v2 机器学习
摘要
我们研究 slate 上下文 bandit 问题中的离策略评估(OPE),在该问题中策略选择被称为 slate 的多维动作。该问题广泛存在于推荐系统、搜索引擎、市场营销及医疗应用中,然而,由于动作空间庞大,典型的逆倾向得分(IPS)估计器存在方差过大的问题,使得有效的 OPE 成为一项重大挑战。伪逆(PI)估计器被引入以通过假设奖励函数的线性来缓解方差问题,但由于该假设难以从观测数据中验证且常被严重违背,这可能导致显著的偏差。为解决先前估计器的局限性,我们为 slate bandit 的 OPE 开发了一种新颖的估计器,称为 Latent IPS(LIPS),它在低维 slate 抽象空间中定义重要性权重,并以数据驱动的方式优化 slate 抽象,以最小化 LIPS 的偏差和方差。通过这样做,LIPS 能够在不施加诸如线性等对奖励函数结构的严格假设的情况下,大幅降低 IPS 的方差。通过实证评估,我们证明 LIPS 显著优于现有估计器,特别是在具有非线性奖励和庞大 slate 空间的场景中。
引用
@article{arxiv.2402.02171,
title = {Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction},
author = {Haruka Kiyohara and Masahiro Nomura and Yuta Saito},
journal= {arXiv preprint arXiv:2402.02171},
year = {2024}
}
备注
WWW2024