非参数情境动态定价的迁移学习
机器学习
2025-02-03 v1 统计理论
统计方法学
统计理论
摘要
动态定价策略对企业至关重要,以通过调整价格来最大化收入。然而,在历史数据有限的情况下(如新产品发布或进入新市场时),设计最优定价策略变得具有挑战性。一个有前景的解决方法是利用来自相关产品或市场的信息来为焦点定价决策提供指导。本文探索了在协变量迁移模型下,对非参数情境动态定价进行迁移学习,该模型中,源域和目标域的协变量边缘分布不同,但奖励函数相同。我们提出了一种 novel 动态定价迁移学习(TLDP)算法,能够有效利用来自源域的预收集数据来增强目标域中的定价决策。我们在奖励函数满足简单Lipschitz条件下,建立了TLDP的regret上界。为建立TLDP的最优性,我们进一步推导了一个匹配的minimax下界,该下界包括作为特例的仅针对目标域的情况,并在文献中首次提出。大量数值实验验证了我们的方法,表明其优于现有方法,并突显其在实际应用中的实用性。
引用
@article{arxiv.2501.18836,
title = {Transfer Learning for Nonparametric Contextual Dynamic Pricing},
author = {Fan Wang and Feiyu Jiang and Zifeng Zhao and Yi Yu},
journal= {arXiv preprint arXiv:2501.18836},
year = {2025}
}