中文

通过部署高效策略学习安全探索推荐系统中的新型动作

人工智能 2025-10-10 v1

摘要

在许多实际推荐系统中,新型物品会不断添加。对充分呈现新型动作的重要性已被广泛认可,以提高长期用户参与度。最近的工作基于离政策学习 (OPL),仅从已记录数据训练策略,但现有方法在新型动作存在时可能不安全。我们的目标是开发一个框架,以确保安全地探索新型动作。为此,我们首先开发了安全离政策策略梯度 (Safe OPG),这是一种基于高置信区间离政策评估的无模型安全OPL方法。在我们的第一次实验中,我们观察到Safe OPG几乎总能满足安全要求,即使现有方法严重违反也未必。然而,结果也表明Safe OPG倾向于过于保守,这表明在保证安全与探索新型动作之间存在困难的权衡。为克服这种权衡,我们还提出了一个名为面向部署的安全用户探索策略学习的新框架,该框架利用安全裕度并在多个(而非大量)部署期间逐渐放宽安全正则化。我们的框架从而实现了在保证推荐系统安全实施的同时探索新型动作。

关键词

引用

@article{arxiv.2510.07635,
  title  = {Safely Exploring Novel Actions in Recommender Systems via Deployment-Efficient Policy Learning},
  author = {Haruka Kiyohara and Yusuke Narita and Yuta Saito and Kei Tateno and Takuma Udagawa},
  journal= {arXiv preprint arXiv:2510.07635},
  year   = {2025}
}