中文

通过优化抽象进行 Slate Bandit 策略的离策略评估

机器学习 2024-02-20 v2 机器学习

摘要

我们研究 slate 上下文 bandit 问题中的离策略评估(OPE),在该问题中策略选择被称为 slate 的多维动作。该问题广泛存在于推荐系统、搜索引擎、市场营销及医疗应用中,然而,由于动作空间庞大,典型的逆倾向得分(IPS)估计器存在方差过大的问题,使得有效的 OPE 成为一项重大挑战。伪逆(PI)估计器被引入以通过假设奖励函数的线性来缓解方差问题,但由于该假设难以从观测数据中验证且常被严重违背,这可能导致显著的偏差。为解决先前估计器的局限性,我们为 slate bandit 的 OPE 开发了一种新颖的估计器,称为 Latent IPS(LIPS),它在低维 slate 抽象空间中定义重要性权重,并以数据驱动的方式优化 slate 抽象,以最小化 LIPS 的偏差和方差。通过这样做,LIPS 能够在不施加诸如线性等对奖励函数结构的严格假设的情况下,大幅降低 IPS 的方差。通过实证评估,我们证明 LIPS 显著优于现有估计器,特别是在具有非线性奖励和庞大 slate 空间的场景中。

关键词

引用

@article{arxiv.2402.02171,
  title  = {Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction},
  author = {Haruka Kiyohara and Masahiro Nomura and Yuta Saito},
  journal= {arXiv preprint arXiv:2402.02171},
  year   = {2024}
}

备注

WWW2024