基于深度强化学习的电商平台的动态定价:一项现场实验
机器学习
2021-09-01 v3 机器学习
摘要
在本文中,我们提出一个端到端框架,利用基于深度强化学习(DRL)的方法解决电商平台上的动态定价(DP)问题。通过使用四组不同的业务数据来表示每个时间周期的状态,我们将动态定价问题建模为马尔可夫决策过程(MDP)。与最先进的基于 DRL 的动态定价算法相比,我们的方法做出了以下三点贡献。首先,我们将离散集合问题扩展至连续价格集合。其次,我们不直接使用收益作为奖励函数,而是定义了一种新的函数,称为收益转化率之差(DRCR)。第三,通过利用精心挑选的历史销售数据进行预训练与评估,解决了 MDP 的冷启动问题。我们的方法通过两种方式进行评估:一是使用阿里巴巴集团真实数据集的离线评估方法,二是自 2018 年 7 月起在 Tmall.com 上持续数月、涉及数千商品的在线现场实验。据我们所知,此前没有其他使用 DRL 的 DP 现场实验。现场实验结果表明,DRCR 是比当前文献广泛使用的收益更合适的奖励函数。此外,连续价格集合的表现优于离散集合,且我们的方法显著优于运营专家的人工定价。
引用
@article{arxiv.1912.02572,
title = {Dynamic Pricing on E-commerce Platform with Deep Reinforcement Learning: A Field Experiment},
author = {Jiaxi Liu and Yidong Zhang and Xiaoqing Wang and Yuming Deng and Xingyu Wu},
journal= {arXiv preprint arXiv:1912.02572},
year = {2021}
}
备注
9 pages, 7 figures