加速离线强化学习在实时竞价与推荐中的应用:仿真的潜在用途
机器学习
2021-09-20 v1
摘要
在推荐系统(RecSys)与在线广告实时竞价(RTB)中,我们常尝试使用 bandit 与强化学习(RL)技术优化序贯决策。在这些应用中,离线强化学习(offline RL)与离屏策略评估(OPE)大有裨益,因为它们仅使用日志数据即可实现安全的策略优化,无需任何有风险的在线交互。在本立场论文中,我们探讨利用仿真加速 offline RL 与 OPE 实际应用研究的潜力,尤其在 RecSys 与 RTB 中。具体地,我们讨论仿真如何助力开展 offline RL 与 OPE 的实证研究。我们持一立场,主张应在 offline RL 与 OPE 的实证研究中有效使用仿真。为反驳仅使用真实世界数据的实验更可取的反对意见,我们首先指出真实世界实验中潜在的风险与可复现性问题。随后,我们描述如何通过仿真解决这些问题。此外,我们展示如何结合真实世界与基于仿真实验二者的优势以捍卫我们的立场。最后,我们针对 RecSys 与 RTB 中进一步促进 offline RL 与 OPE 实际应用研究,提出一个开放挑战,涉及公共仿真平台。作为该问题的一个可能方案,我们展示了正在进行的开源项目及其潜在用例。我们相信,构建并利用面向 offline RL 与 OPE 的基于仿真的评估平台,对 RecSys 与 RTB 社区将极具价值与相关意义。
引用
@article{arxiv.2109.08331,
title = {Accelerating Offline Reinforcement Learning Application in Real-Time Bidding and Recommendation: Potential Use of Simulation},
author = {Haruka Kiyohara and Kosuke Kawakami and Yuta Saito},
journal= {arXiv preprint arXiv:2109.08331},
year = {2021}
}
备注
SimuRec workshop at RecSys2021