基于动态定价的序列显示互补商品的原始-对偶在线学习方法
机器学习
2024-07-09 v1 最优化与控制
摘要
我们解决了针对顺序显示给客户的互补商品进行动态定价的挑战性问题。一个 illustrative 的例子是机票的线上出售,客户会依次浏览多个网页。最初,他们查看机票费用,随后是保险和额外行李费等附加费用。针对互补商品的连贯定价政策至关重要,因为单独优化每个商品的定价是无效的。我们的场景还涉及销售约束,即指定的最低销售数量,以及关于客户需求曲线的不确定性。为解决此问题,我们原始地将其形式化为带约束的马尔可夫决策过程。利用在线学习工具,我们设计了一个原始-对偶在线优化算法。我们使用从真实世界数据中随机生成的合成设置进行了经验评估,涵盖从平稳到非平稳的各种配置,并根据约束违规和后悔情况与既定基线进行比较,后者针对每个状态进行单独优化。
引用
@article{arxiv.2407.05793,
title = {A Primal-Dual Online Learning Approach for Dynamic Pricing of Sequentially Displayed Complementary Items under Sale Constraints},
author = {Francesco Emanuele Stradi and Filippo Cipriani and Lorenzo Ciampiconi and Marco Leonardi and Alessandro Rozza and Nicola Gatti},
journal= {arXiv preprint arXiv:2407.05793},
year = {2024}
}