预言机高效的悲观主义:上下文_bandit中的离线策略优化
机器学习
2023-10-27 v2
摘要
我们考虑上下文_bandit中的离线策略优化(OPO),其中给定一份固定的记录交互数据集。虽然悲观正则化项通常用于缓解分布偏移,但此前的相关实现要么过于专门化,要么计算效率低下。我们提出了首个用于悲观OPO的通用预言机高效算法:它可归约为监督学习,从而具有广泛的适用性。我们获得了与先前悲观方法类似的统计保证。我们在离散与连续动作两种情形下分别实例化所提方法,并在两类设置下开展实验,展示了其在广泛配置范围内相对未正则化OPO的优势。
引用
@article{arxiv.2306.07923,
title = {Oracle-Efficient Pessimism: Offline Policy Optimization in Contextual Bandits},
author = {Lequn Wang and Akshay Krishnamurthy and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:2306.07923},
year = {2023}
}