面向基于强化学习的推荐中带隐藏混杂因子的环境重建
机器学习
2019-07-16 v1 人工智能
机器学习
摘要
强化学习旨在搜索用于决策的最佳策略模型,并已被证明在序列推荐中十分强大。然而,通过强化学习进行的策略训练被置于一个环境中。但在许多现实应用中,由于环境中的探索,在真实环境中训练策略会造成难以承受的代价。因此,从过去数据中进行环境重建成为在这些应用中释放强化学习能力的一种吸引人的方式。环境重建基本上是要从数据中提取因果效应模型。然而,现实应用往往过于复杂,无法提供完全可观察的环境信息。因此,数据中很可能潜藏着未观测的混杂变量。隐藏混杂因子会阻碍环境的有效重建。在本文中,通过将隐藏混杂因子视为隐藏策略,我们提出一种去混杂多智能体环境重建(DEMER)方法,以连同隐藏混杂因子一起学习环境。DEMER 采用多智能体生成对抗模仿学习框架。它提出引入嵌入混杂因子的策略,并使用兼容判别器来训练策略。随后我们将 DEMER 应用于司机程序推荐这一应用。我们首先使用一个从真实应用中抽象出的人工司机程序推荐环境来验证和分析 DEMER 的有效性。然后在滴滴出行的真实应用中测试 DEMER。实验结果表明,DEMER 能有效重建隐藏混杂因子,从而更好地构建环境。DEMER 还推导出一种在真实应用测试阶段性能显著提升的推荐策略。
引用
@article{arxiv.1907.06584,
title = {Environment Reconstruction with Hidden Confounders for Reinforcement Learning based Recommendation},
author = {Wenjie Shang and Yang Yu and Qingyang Li and Zhiwei Qin and Yiping Meng and Jieping Ye},
journal= {arXiv preprint arXiv:1907.06584},
year = {2019}
}
备注
Appears in KDD 2019