中文

多任务 Bandit 中基于共享结构的协同探索与协同利用

机器学习 2025-12-16 v1 人工智能

摘要

我们提出了一种新颖的贝叶斯框架,用于在上下文多任务多臂 Bandit 设置中进行高效探索,其中上下文仅被部分观测,且奖励分布之间的依赖关系由潜在上下文变量诱导。为了利用这些结构依赖性,我们的方法整合了所有任务的观测并学习全局联合分布,同时仍允许对新任务进行个性化推理。在这方面,我们识别出两个关键的认知不确定性来源,即跨臂和跨任务的潜在奖励依赖中的结构性不确定性,以及由于上下文不完整和交互历史有限而产生的用户特定不确定性。为了将我们的方法付诸实践,我们使用基于粒子的对数密度高斯过程近似来表示任务和奖励上的联合分布。这种表示能够在不对潜在变量作先验假设的情况下,灵活地、数据驱动地发现臂间和任务间的依赖关系。在实验上,我们证明了我们的方法优于分层模型 Bandit 等基线,特别是在模型误设或潜在异质性复杂的设置中。

关键词

引用

@article{arxiv.2512.12693,
  title  = {Co-Exploration and Co-Exploitation via Shared Structure in Multi-Task Bandits},
  author = {Sumantrak Mukherjee and Serafima Lebedeva and Valentin Margraf and Jonas Hanselle and Kanta Yamaoka and Viktor Bengs and Stefan Konigorski and Eyke Hüllermeier and Sebastian Josef Vollmer},
  journal= {arXiv preprint arXiv:2512.12693},
  year   = {2025}
}

备注

18 pages, 9 figures, preprint