对抗式批量逆强化学习:从非完美示范中学习奖励用于交互式推荐
机器学习
2023-10-31 v1 信息检索
摘要
奖励作为用户满意度的度量,是交互式推荐系统中的限制因素。本研究关注学习奖励(LTR)问题,其为强化学习的基础。先前方法要么引入额外过程以学习奖励,从而增加优化复杂度,要么假设用户-智能体交互提供完美示范,而这在实践中不可行。理想情况下,我们旨在采用统一方法,利用组合示范同时优化奖励与策略。然而,该需求带来挑战:奖励本质上量化用户在策略上的反馈,而推荐智能体近似离策略的未来累积价值。为应对此挑战,我们提出一种新颖的批量逆强化学习范式,具备所需性质。我们的方法利用折扣平稳分布校正将 LTR 与推荐智能体评估相结合。为满足组合需求,我们通过保守引入悲观主义概念。具体地,我们使用贝尔曼变换修改原始校正,并施以 KL 正则化以约束连续策略更新。我们使用两个代表两种组合覆盖度的真实世界数据集进行实证研究,结果也表明所提方法相对提升了有效性(2.3%)与效率(11.53%)。
引用
@article{arxiv.2310.19536,
title = {Adversarial Batch Inverse Reinforcement Learning: Learn to Reward from Imperfect Demonstration for Interactive Recommendation},
author = {Jialin Liu and Xinyan Su and Zeyu He and Xiangyu Zhao and Jun Li},
journal= {arXiv preprint arXiv:2310.19536},
year = {2023}
}