Virtual-Taobao:面向强化学习的真实世界在线零售环境虚拟化
人工智能
2018-05-28 v1
摘要
在物理世界任务中应用强化学习极具挑战性。当前强化学习方法所需的大量试验采样在物理环境中通常不可行。本文报道了我们在淘宝(最大的在线零售平台之一,同时也是采样成本极高的物理环境)中使用强化学习改进商品搜索的项目。我们不直接在淘宝中训练强化学习,而是提出如下方法:首先通过所提出的GAN-SD(用于模拟分布的GAN)与MAIL(多智能体对抗模仿学习)从历史客户行为数据学习构建模拟器Virtual Taobao,随后在Virtual Taobao中以零物理成本训练策略,其中提出ANC(动作范数约束)策略以减轻过拟合。实验中,Virtual Taobao由数亿条客户记录训练而来,并将其性质与真实环境进行比较。结果显示Virtual Taobao忠实地恢复了真实环境的重要性质。我们还表明,在Virtual Taobao中训练的策略在线表现显著优于传统监督方法。希望我们的工作能为复杂物理环境中的强化学习应用提供启示。
引用
@article{arxiv.1805.10000,
title = {Virtual-Taobao: Virtualizing Real-world Online Retail Environment for Reinforcement Learning},
author = {Jing-Cheng Shi and Yang Yu and Qing Da and Shi-Yong Chen and An-Xiang Zeng},
journal= {arXiv preprint arXiv:1805.10000},
year = {2018}
}