中文

双线性_bandit纯探索中的多任务表示学习

机器学习 2023-11-02 v1

摘要

我们研究双线性 bandit 纯探索问题中的多任务表示学习。在双线性 bandit 中,动作由来自两类不同实体的臂对组成,奖励是臂的已知特征向量的双线性函数。在多头双线性 bandit 问题中,我们旨在为共享公共低维线性表示的多个任务寻找最优动作。目标是利用该特性加速为所有任务识别最佳臂对的过程。我们提出算法 GOBLIN,其采用实验设计方法优化用于学习全局表示的样本分配,并最小化在各任务中识别最优臂对所需的样本数。据我们所知,这是首个针对具有共享表示的双线性 bandit 纯探索给出样本复杂度分析的研究。我们的结果表明,通过学习跨任务的共享表示,与独立求解任务的传统方法相比,我们实现了显著改善的样本复杂度。

关键词

引用

@article{arxiv.2311.00327,
  title  = {Multi-task Representation Learning for Pure Exploration in Bilinear Bandits},
  author = {Subhojyoti Mukherjee and Qiaomin Xie and Josiah P. Hanna and Robert Nowak},
  journal= {arXiv preprint arXiv:2311.00327},
  year   = {2023}
}

备注

Accepted in 37th Conference on Neural Information Processing Systems (NeurIPS 2023)