用于悲观离线策略评估、选择与学习的对数平滑
机器学习
2024-11-01 v2 机器学习
摘要
本工作研究上下文赌博机问题的离线形式,其目标是利用在行为策略下收集的过往交互来评估、选择和学习新的、可能性能更好的策略。受关键应用启发,我们超越了点估计。相反,我们采用悲观原则,构建评估策略最坏情况性能的上界,从而能够自信地选择和学习改进的策略。具体而言,我们为一大类重要性加权风险估计量引入了全新的、完全经验性的集中界。这些界足够通用,可以覆盖大多数现有估计量,并为新估计量的开发铺平道路。特别地,我们在此类中追求最紧的界,从而激发了一种新颖的估计量(LS),它对大的重要性权重进行对数平滑。LS的界被证明比其竞争对手更紧,并自然导致改进的策略选择和学习策略。广泛的策略评估、选择和学习实验突出了LS的多功能性和优越性能。
引用
@article{arxiv.2405.14335,
title = {Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning},
author = {Otmane Sakhi and Imad Aouali and Pierre Alquier and Nicolas Chopin},
journal= {arXiv preprint arXiv:2405.14335},
year = {2024}
}
备注
NeuRIPS '24 Spotlight