中文

上下文线性赌博机中表示学习的复杂性研究

机器学习 2022-12-20 v1 机器学习

摘要

在上下文线性赌博机中,奖励函数被假定为未知奖励向量与给定的上下文-动作对嵌入的线性组合。在实践中,嵌入通常与奖励向量同时学习,从而引出一个在线表示学习问题。现有的上下文赌博机表示学习方法要么非常通用(例如,模型选择技术或用于任意函数类学习的算法),要么专门针对特定结构(例如,嵌套特征或具有特定谱性质的表示)。因此,对上下文线性赌博机中表示学习成本的理解仍然有限。在本文中,我们采用系统性的方法处理该问题,并通过实例依赖的视角提供了一项全面的研究。我们证明,表示学习从根本上比线性赌博机(即使用给定表示进行学习)更为复杂。特别是,使用一组给定的表示进行学习绝不会比学习该集合中最差的可实现表示更简单,而我们展示了它可能任意地更困难的情况。我们通过广泛讨论该结果与现有文献的关联来补充这一发现,并举例说明了表示学习与使用固定表示学习一样复杂以及可实现次对数遗憾的正面实例。

引用

@article{arxiv.2212.09429,
  title  = {On the Complexity of Representation Learning in Contextual Linear Bandits},
  author = {Andrea Tirinzoni and Matteo Pirotta and Alessandro Lazaric},
  journal= {arXiv preprint arXiv:2212.09429},
  year   = {2022}
}