中文

基于函数近似的实验规划

机器学习 2024-01-11 v1 人工智能 机器学习

摘要

我们研究上下文赌博机问题中基于函数近似的实验规划。在部署自适应算法存在显著开销的场景下——例如,当数据收集策略的执行需要分布式进行,或需要人机协同来实现这些策略时——提前生成一组数据收集策略至关重要。我们研究这样一种设置:有大量上下文数据集可用,但奖励未知,学习者可利用该数据集设计有效的数据收集策略。尽管当奖励为线性时该问题已得到充分研究,但对于更复杂的奖励模型仍缺乏结果。在这项工作中,我们提出了两种与函数近似兼容的实验规划策略。第一种是规避规划与采样过程,可根据奖励函数类的规避维度恢复最优性保证。对于第二种,我们证明在动作数量较小的设置下,均匀采样器能达到有竞争力的最优性速率。最后,我们引入一个统计差距来阐明规划与自适应学习之间的根本区别,并给出带模型选择的规划结果。

关键词

引用

@article{arxiv.2401.05193,
  title  = {Experiment Planning with Function Approximation},
  author = {Aldo Pacchiano and Jonathan N. Lee and Emma Brunskill},
  journal= {arXiv preprint arXiv:2401.05193},
  year   = {2024}
}

备注

10 pages main