基于选择模型辅助的延迟反馈收益管理 Q 学习
机器学习
2026-02-03 v1 机器学习
摘要
我们研究了针对延迟反馈的收益管理强化学习问题,其中相当比例的值由客户取消和修改决定,这些取消和修改在预订后数天后才可观察。我们提出了“选择模型辅助强化学习”:使用已校准的离散选择模型作为固定的部分世界模型,在决策时用以插值学习目标的延迟部分。在固定模型部署 regime 下,我们证明了带有模型插值目标的表格 Q 学习将收敛于 邻域内的最优 Q 函数,其中 总结了部分模型误差,额外增加 采样项。对来自 61,619 项酒店预订(1,088 次独立实验)校准的模拟器进行实验,结果显示:(i) 在平稳设置下,与成熟缓冲 DQN 基线无显著差异;(ii) 在 family 内参数偏移情形下呈现积极效果,在 10 个偏移情景中经过 Holm--Bonferroni 校正后有显著提升(最高可达 12.4%);(iii) 在结构性误指定定情境下表现一致下降,其中选择模型假设被违反(收入降低 1.4--2.6%)。这些结果刻画了在偏移情境下部分行为模型何时改善鲁棒性以及何时引入有害偏差。
引用
@article{arxiv.2602.02283,
title = {Choice-Model-Assisted Q-learning for Delayed-Feedback Revenue Management},
author = {Owen Shen and Patrick Jaillet},
journal= {arXiv preprint arXiv:2602.02283},
year = {2026}
}