中文

IBCB:面向行为演化历史的高效逆批量上下文赌博机

机器学习 2025-04-04 v2

摘要

传统的模仿学习侧重于对专家的行为机制进行建模,这需要由某个固定专家生成的大量交互历史。然而,在许多流式应用中,例如流式推荐系统,在线决策者通常在决策过程中进行在线学习,这意味着在线决策者生成的交互历史包含了他们从新手专家到经验丰富专家的行为演化。这对只能利用经验丰富专家数据的现有模仿学习方法提出了新挑战。为了解决这个问题,本文提出了一种逆批量上下文赌博机(IBCB)框架,该框架能够基于专家的行为演化历史,高效地估计环境奖励参数和学习到的策略。具体而言,IBCB 利用奖励不可访问的批量上下文赌博机的行为演化历史,将逆问题转化为一个简单的二次规划问题。我们证明 IBCB 是一个适用于确定性策略和随机性赌博机策略的统一框架。实验结果表明,IBCB 在合成数据和真实世界数据上均优于几种现有的模仿学习算法,并显著减少了运行时间。此外,经验分析表明,IBCB 表现出更好的分布外泛化能力,并且在从新手专家交互历史中学习赌博机策略方面非常有效。

关键词

引用

@article{arxiv.2403.16075,
  title  = {IBCB: Efficient Inverse Batched Contextual Bandit for Behavioral Evolution History},
  author = {Yi Xu and Weiran Shen and Xiao Zhang and Jun Xu},
  journal= {arXiv preprint arXiv:2403.16075},
  year   = {2025}
}

备注

17 pages, submitted to journal