基于交互基学习(IGL)的个性化奖励学习
机器学习
2023-03-07 v2 人工智能
信息检索
摘要
在一个内容产品无数的时代,推荐系统通过向用户提供个性化内容建议来缓解信息过载。由于显式用户反馈的稀缺性,现代推荐系统通常在所有用户上优化相同的、固定的隐式反馈信号组合。然而,这种方法忽视了大量研究,这些研究强调:(i) 用户可能以多种方式使用隐式信号,表达从满意到积极厌恶的任何情绪;(ii) 不同用户以不同方式传达偏好。我们提出应用最近的交互基学习(IGL)范式来应对学习多样化用户沟通模态表征的挑战。IGL 无需固定的、人工设计的奖励函数,而是能够为不同用户学习个性化的奖励函数,然后直接优化潜在的用户满意度。我们通过使用模拟和真实世界生产轨迹的实验,展示了 IGL 的成功。
引用
@article{arxiv.2211.15823,
title = {Personalized Reward Learning with Interaction-Grounded Learning (IGL)},
author = {Jessica Maghakian and Paul Mineiro and Kishan Panaganti and Mark Rucker and Akanksha Saran and Cheng Tan},
journal= {arXiv preprint arXiv:2211.15823},
year = {2023}
}
备注
ICLR 2023