有错界在线学习中反馈代价的界
机器学习
2024-01-18 v2 离散数学
组合数学
摘要
我们改进了(Auer和Long, Machine Learning, 1999)中多种在线学习场景的几个最坏情况界。特别地,我们将延迟模糊强化学习的一个上界锐化了2倍,并将函数族组合学习的一个上界锐化了2.41倍。我们还改进了同一篇论文中关于学习k个函数族组合的一个下界,改进因子为Θ(ln k),使其与上界在常数因子内匹配。此外,我们解决了(Long, Theoretical Computer Science, 2020)中关于多类学习中强盗反馈相对于标准反馈的代价问题,并将(Feng等人, Theoretical Computer Science, 2023)中关于r-输入延迟模糊强化学习代价的一个上界改进了r倍,使其与同一篇论文中的下界在首项上匹配。
引用
@article{arxiv.2401.05794,
title = {Bounds on the price of feedback for mistake-bounded online learning},
author = {Jesse Geneson and Linus Tang},
journal= {arXiv preprint arXiv:2401.05794},
year = {2024}
}