非平稳环境下的未来策略评估与学习
机器学习
2025-06-26 v1 人工智能
摘要
我们研究了未来策略评估 (F-OPE) 和学习 (F-OPL) 的新问题,即用于估计和优化非平稳环境中策略的未来价值,其中分布随时间变化。在电商推荐中,我们通常希望使用旧策略在前一个月收集的数据来估计和优化下一个月的策略价值。一个关键挑战是,与未来环境相关的数据在历史数据中并未观察到。现有方法假设平稳性或依赖于限制性的奖励建模假设,导致显著偏差。为克服这些限制,我们提出了一种新型估计器,称为 \textbf{\textit{OPFV}} (Off-Policy Estimator for the Future Value),用于在任意未来时间点准确估计策略价值。OPFV 的关键特征是能够利用时间序列数据中的有用结构。虽然未来数据可能不存在于历史日志中,但我们可以利用季节性、周效应或节假日效应等在历史数据和未来数据中保持一致的特征。我们的估计器首次通过一种新型重要性加权来利用这些时间相关结构,从而实现有效的 F-OPE。理论分析确定了 OPFV 低偏差的条件。此外,我们扩展了该估计器以开发一种新的策略梯度方法,仅使用历史数据即可主动学习良好的未来策略。实验结果表明,我们的方法在各种实验设置下在估计和优化非平稳环境下的未来策略价值方面显著优于现有方法。
引用
@article{arxiv.2506.20417,
title = {Off-Policy Evaluation and Learning for the Future under Non-Stationarity},
author = {Tatsuhiro Shimizu and Kazuki Kawamura and Takanori Muroi and Yusuke Narita and Kei Tateno and Takuma Udagawa and Yuta Saito},
journal= {arXiv preprint arXiv:2506.20417},
year = {2025}
}