中文

优惠券分配中的即时收入与未来置偏评估的平衡

机器学习 2024-09-10 v3 人工智能

摘要

优惠券分配驱动客户购买,提升收入。然而,这构成了一种根本性的权衡:即利用当前最优策略以最大化即时收入,又探索替代策略以收集数据,用于通过置偏评估(Off-Policy Evaluation, OPE)改进未来政策。为平衡这一权衡,我们提出了一种新方法,将基于模型的收入最大化政策与随机化探索政策结合用于数据收集。我们的框架使可以灵活调整这两种政策之间的混合比例,以优化短期收入与未来政策改进之间的平衡。我们将确定最优混合比例的问题建模为多目标优化问题,实现对这一权衡的量化评估。我们使用合成数据经验验证了所提出混合政策的有效性。我们的主要贡献包括:(1) 显示结合确定性政策和概率政策的混合政策,可灵活调整数据收集与收入之间的权衡;(2) 将最优混合比例问题建模为多目标优化,实现对这一权衡的量化评估。

关键词

引用

@article{arxiv.2407.11039,
  title  = {Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation},
  author = {Naoki Nishimura and Ken Kobayashi and Kazuhide Nakata},
  journal= {arXiv preprint arXiv:2407.11039},
  year   = {2024}
}