中文

面向个性化奖励的可证明高效的交互式 grounding 学习

机器学习 2024-06-03 v1 机器学习

摘要

交互式 grounding 学习(Interactive-Grounded Learning, IGL)[Xie et al., 2021] 是一个强大的框架,学习者通过与环境交互并观察由行动所产生的奖励依赖反馈来最大化不可观测的奖励。在处理常见于推荐系统等应用场景中的个性化奖励问题时,Maghakian 等人 [2022] 研究了带有上下文依赖反馈的 IGL 版本,但其算法缺乏理论保证。本文在同一问题上提供了首个在实用性假设下具有亚线性 regret 的可证明高效算法。我们的分析揭示了前工作中基于阶梯函数的估计器会因有限样本效应而失控。我们的解决方案是一种新颖的 Lipschitz 奖励估计器,它低估真实奖励并表现出良好的泛化性能。基于该估计器,我们提出两种算法:一种基于 explore-then-exploit,另一种基于 inverse-gap 加权。我们将 IGL 应用于图像反馈学习和文本反馈学习,这些都是实际场景中出现的奖励-free 设置。实验结果展示了使用 Lipschitz 奖励估计器的重要性以及我们算法的总体有效性。

关键词

引用

@article{arxiv.2405.20677,
  title  = {Provably Efficient Interactive-Grounded Learning with Personalized Reward},
  author = {Mengxiao Zhang and Yuheng Zhang and Haipeng Luo and Paul Mineiro},
  journal= {arXiv preprint arXiv:2405.20677},
  year   = {2024}
}