中文

若干误界在线学习模型的 bandit 反馈代价的紧界

机器学习 2022-09-07 v1 离散数学 组合数学

摘要

我们确定了误界模型若干变体的 bandit 反馈代价的紧界。本文第一部分给出了 rr-输入弱强化模型与 rr-输入延迟模糊强化模型的界。在两个模型中,adversary 每轮给出 rr 个输入,且仅当所有 rr 个猜测都正确时才指示一个正确答案。两模型唯一的区别在于,在延迟模糊模型中,学习器必须在接收该轮下一个输入前对每个输入作答,而在弱强化模型中学习器一次性接收所有 rr 个输入。在本文第二部分,我们引入了带置换模式的在线学习模型,其中学习器通过猜测与子置换相关的统计量,试图从一组置换中学习一个置换。对于这些置换模型,我们证明了 bandit 反馈代价的紧界。

关键词

引用

@article{arxiv.2209.01366,
  title  = {Sharp bounds on the price of bandit feedback for several models of mistake-bounded online learning},
  author = {Raymond Feng and Jesse Geneson and Andrew Lee and Espen Slettnes},
  journal= {arXiv preprint arXiv:2209.01366},
  year   = {2022}
}