中文

非参数学习与非平稳情境下的单点反馈学习与收益

机器学习 2026-05-21 v1

摘要

企业日益依赖动态定价以应对不断变化的客户需求,但在许多应用中,他们仅观察每个时期由单个挂出价格产生的收入。同时,市场条件可能因客户偏好变化、竞争或外部冲击而逐渐或突然地改变。这些特征创造了两个交织的挑战:从有限反馈中学习收入-需求关系,并适应变化的环境。我们研究了在这些约束下,卖方如何有效地学习与收益,同时不假设需求的特定参数形式。我们发展了一个学习框架,使用从每个时期单个观察中构建的基于收益的梯度近似值来更新价格。为解决环境变化问题,我们纳入了一个重启机制,定期刷新学习过程,以折旧过时的信息。当非平稳性的程度未知时,我们进一步引入一个元学习层,对多种重启方案进行自适应对冲。我们对该方法提供了性能保证,展示了相对于完全知情基准的累计收入损失如何取决于时间范围和市场变动的幅度。使用合成数据和真实世界数据进行的仿真实验表明,所提出的程序在有效性方面具有显著效果。

关键词

引用

@article{arxiv.2605.21263,
  title  = {Nonparametric Learning and Earning with One-Point Feedback under Nonstationarity},
  author = {Xiangyu Yang and Feng Xu and Jian-Qiang Hu and Jiaqiao Hu},
  journal= {arXiv preprint arXiv:2605.21263},
  year   = {2026}
}