若干误界在线学习模型的 bandit 反馈代价的紧界
机器学习
2022-09-07 v1 离散数学
组合数学
摘要
我们确定了误界模型若干变体的 bandit 反馈代价的紧界。本文第一部分给出了 -输入弱强化模型与 -输入延迟模糊强化模型的界。在两个模型中,adversary 每轮给出 个输入,且仅当所有 个猜测都正确时才指示一个正确答案。两模型唯一的区别在于,在延迟模糊模型中,学习器必须在接收该轮下一个输入前对每个输入作答,而在弱强化模型中学习器一次性接收所有 个输入。在本文第二部分,我们引入了带置换模式的在线学习模型,其中学习器通过猜测与子置换相关的统计量,试图从一组置换中学习一个置换。对于这些置换模型,我们证明了 bandit 反馈代价的紧界。
引用
@article{arxiv.2209.01366,
title = {Sharp bounds on the price of bandit feedback for several models of mistake-bounded online learning},
author = {Raymond Feng and Jesse Geneson and Andrew Lee and Espen Slettnes},
journal= {arXiv preprint arXiv:2209.01366},
year = {2022}
}