Epsilon-Greedy探索的优化
机器学习
2025-06-05 v1
摘要
现代推荐系统依赖探索来学习用户对新物品的偏好,通常实施均匀探索策略(例如epsilon-greedy),因为它们简单且与机器学习(ML)个性化模型兼容。在这些系统中,一个关键的考虑因素是探索率——多少比例的用户流量应接收随机物品推荐,以及这应如何随时间演变。虽然存在各种启发式方法来导航由此产生的探索-利用权衡,但选择最优探索率受到实际约束的复杂影响,包括批量更新、随时间变化的用户流量、短时间范围和最小探索要求。在这项工作中,我们提出了一个基于通过随机梯度下降(SGD)直接最小化贝叶斯遗憾来确定探索计划的框架,允许通过模型预测控制(MPC)进行动态探索率调整。通过对推荐数据集的广泛实验,我们证明了各时期批量大小的变化显著影响最优探索策略。我们的优化方法自动将探索校准到特定的问题设置,始终匹配或超越每个设置的最佳启发式方法。
引用
@article{arxiv.2506.03324,
title = {Optimization of Epsilon-Greedy Exploration},
author = {Ethan Che and Hakan Ceylan and James McInerney and Nathan Kallus},
journal= {arXiv preprint arXiv:2506.03324},
year = {2025}
}