面向通用行为倾向推断的生成对抗奖励学习
机器学习
2021-05-06 v2 人工智能
信息检索
摘要
强化学习的最新进展激发了人们通过动态交互自适应地学习用户建模的兴趣,例如在基于强化学习的推荐系统中。奖励函数对大多数强化学习应用至关重要,因为它能提供关于优化的指导。然而,当前基于强化学习的方法依赖于人工定义的奖励函数,无法适应动态和噪声环境。此外,它们通常使用特定任务的奖励函数,牺牲了泛化能力。我们提出了一种用于用户行为偏好建模的生成式逆强化学习,以解决上述问题。我们的模型不采用预定义奖励函数,而是基于判别型actor-critic网络和Wasserstein GAN从用户动作中自动学习奖励。我们的模型提供了一种刻画和解释潜在行为倾向的通用方法,并且我们的实验表明,我们的方法在多种场景中优于最先进的方法,即交通信号控制、在线推荐系统和扫描路径预测。
引用
@article{arxiv.2105.00822,
title = {Generative Adversarial Reward Learning for Generalized Behavior Tendency Inference},
author = {Xiaocong Chen and Lina Yao and Xianzhi Wang and Aixin Sun and Wenjie Zhang and Quan Z. Sheng},
journal= {arXiv preprint arXiv:2105.00822},
year = {2021}
}