更好一点?面向bandit学习的信息量化
机器学习
2021-02-19 v1
摘要
信息比提供了一种评估智能体在探索与利用间平衡成效的方法。最初,其定义为期望 regret 平方与环境和动作-观测对之间互信息(代表信息增益的度量)之比。近期工作启发了对替代信息度量的考量,尤其用于bandit学习算法分析以获得更紧的 regret 界。我们研究通过此类替代方式量化信息能否改善信息导向采样的信息比最小化实际性能。
引用
@article{arxiv.2102.09488,
title = {A Bit Better? Quantifying Information for Bandit Learning},
author = {Adithya M. Devraj and Benjamin Van Roy and Kuang Xu},
journal= {arXiv preprint arXiv:2102.09488},
year = {2021}
}
备注
41 pages, 10 figures, 1 table