中文

面向具有非线性Bandit反馈与多样性约束的Top-K组合多臂老虎机的主从深度架构

机器学习 2023-08-25 v1 分布式、并行与集群计算 最优化与控制 机器学习

摘要

我们提出了一种新颖的主从架构,用于解决具有非线性bandit反馈和多样性约束的top-KK组合多臂老虎机问题,据我们所知,这是首个在bandit反馈下考虑多样性约束的组合老虎机设定。具体而言,为高效探索组合且受约束的动作空间,我们引入了六个各具优势的从模型,以生成在奖励、约束与效率之间取得良好平衡的多样化样本。此外,我们提出了基于教师学习的优化与策略协同训练技术,以提升多个从模型的性能。主模型随后收集从模型提供的精英样本,并通过基于神经上下文UCB的网络估计选出最佳样本,在探索与利用之间权衡以做出决策。得益于从模型的精心设计、从模型间的协同训练机制以及主从模型间的新颖交互,我们的方法在推荐任务的合成与真实数据集上均显著超越现有的state-of-the-art算法。代码见:\url{https://github.com/huanghanchi/Master-slave-Algorithm-for-Top-K-Bandits}。

关键词

引用

@article{arxiv.2308.12680,
  title  = {Master-slave Deep Architecture for Top-K Multi-armed Bandits with Non-linear Bandit Feedback and Diversity Constraints},
  author = {Hanchi Huang and Li Shen and Deheng Ye and Wei Liu},
  journal= {arXiv preprint arXiv:2308.12680},
  year   = {2023}
}

备注

IEEE Transactions on Neural Networks and Learning Systems