局部探索的情境动态定价实现无维度 regret
机器学习
2024-12-30 v1 机器学习
最优化与控制
摘要
我们研究线性需求模型下的情境动态定价问题。提出一种新颖的局部探索-提交(LetC)算法,先进行纯粹探索阶段,再进行细化阶段以在所学最优定价策略附近探索,最后进入纯利用阶段。该算法在时间范围超过协变量维度的多项式后,实现最小混沌、无维度 regret上界。此外,我们提供一个涵盖整个时间范围的通用理论框架,说明在时间范围受限时的探索与利用如何进行平衡。分析的动力来源于一种新型关键不等式,描绘了动态定价中的探索-利用权衡,类似于正则化回归中偏差-方差权衡的现有对应关系。我们的理论结果通过合成数据和真实世界数据的大量实验得到验证。
引用
@article{arxiv.2412.19252,
title = {Localized exploration in contextual dynamic pricing achieves dimension-free regret},
author = {Jinhang Chai and Yaqi Duan and Jianqing Fan and Kaizheng Wang},
journal= {arXiv preprint arXiv:2412.19252},
year = {2024}
}
备注
60 pages, 9 figures