面向部分观测奖励的 off-policy 学习通用框架
机器学习
2025-06-18 v1
摘要
在情境 bandits 中,off-policy 学习(OPL)旨在仅使用之前开发策略收集的历史交互数据来学习最大化目标奖励的决策策略。然而,当奖励仅部分观测时,OPL 的效果会严重下降。此类部分奖励的著名例子包括内容推荐中的显式评分、电子商务平台上因延迟导致的转换信号,以及医学问题中的 censoring 问题。处理此类部分奖励的一种可能方法是使用次要奖励,如停留时间、点击和医疗指标,这些指标更密集地被观察。然而,仅依赖次要奖励也会导致策略学习不佳,因为它们可能不与目标奖励一致。因此,本 work 研究了一个新问题:OPL 的目标是通过利用密集观测的次要奖励作为补充数据来学习最大化预期目标奖励的策略。我们提出了一种新方法称为部分观测奖励混合策略优化(HyPeR),有效地在目标奖励部分观测的基础上,利用次要奖励以实现有效的 OPL,尽管处于具有挑战性的情境。我们还讨论了旨在优化不仅预期目标奖励,还一定程度地优化预期次要奖励的情况;尽管直觉上这似乎矛盾,我们将展示,利用这两个目标实际上也有助于仅优化目标奖励。本 work 附带对所提出方法的统计分析,并通过合成数据和真实世界数据进行经验评估,表明 HyPeR 在各种情境中优于现有方法。
引用
@article{arxiv.2506.14439,
title = {A General Framework for Off-Policy Learning with Partially-Observed Reward},
author = {Rikiya Takehi and Masahiro Asami and Kosuke Kawakami and Yuta Saito},
journal= {arXiv preprint arXiv:2506.14439},
year = {2025}
}
备注
10 pages, 5 figures. Published as a conference paper at ICLR 2025