具有延迟反馈的预算推荐
机器学习
2024-05-21 v1
摘要
在传统的上下文多臂老虎机问题中,反馈(或奖励)在动作后立即可观测。然而,延迟反馈出现在许多现实场景中,并且在时间敏感的应用中尤为关键。在这种条件下,探索-利用困境变得特别具有挑战性,因为它与延迟和有限资源之间的相互作用耦合在一起。此外,有限的预算往往通过限制探索潜力而加剧问题。一个激励性例子是COVID-19早期医疗物资的分配。检测结果的延迟反馈导致学习信息不足,降低了资源分配的效率。受此类应用启发,我们研究了延迟反馈对约束上下文老虎机的影响。我们开发了一种决策策略——面向延迟的资源分配与学习(DORAL),以优化具有臂相关延迟反馈的上下文多臂老虎机问题中的资源支出。
引用
@article{arxiv.2405.11417,
title = {Budgeted Recommendation with Delayed Feedback},
author = {Kweiguu Liu and Setareh Maghsudi},
journal= {arXiv preprint arXiv:2405.11417},
year = {2024}
}