具有常数后悔保证的线性上下文_bandit_中可扩展表示学习
机器学习
2022-10-25 v1
摘要
我们研究随机上下文线性 bandit 中的表示学习问题。虽然该领域的主要关注点通常是找到可实现的表示(即那些能在任意上下文-动作对上精确预测奖励函数的表示),但最近研究表明具有某些谱性质(称为 HLS)的表示可能对探索-利用任务更有效,使 LinUCB 能够实现常数(即与 horizon 无关)后悔。本文提出 BanditSRL,一种表示学习算法,它结合了一个新的约束优化问题以学习具有良好谱性质的可实现表示,以及一种广义似然比检验以利用恢复出的表示并避免过度探索。我们证明 BanditSRL 可与任意无后悔算法配对,并在存在 HLS 表示时实现常数后悔。此外,BanditSRL 可轻松与深度神经网络结合,我们展示了在标准基准上正则化趋向 HLS 表示是有益的。
引用
@article{arxiv.2210.13083,
title = {Scalable Representation Learning in Linear Contextual Bandits with Constant Regret Guarantees},
author = {Andrea Tirinzoni and Matteo Papini and Ahmed Touati and Alessandro Lazaric and Matteo Pirotta},
journal= {arXiv preprint arXiv:2210.13083},
year = {2022}
}
备注
Accepted at Neurips 2022