上下文潘多拉魔盒问题
机器学习
2025-09-30 v3
摘要
潘多拉魔盒是一个基本的随机优化问题,其中决策者必须在最小化探索各备选方案价值的搜索成本的同时找到较好的备选方案。在原始表述中,假设所有备选方案的价值均给定准确分布,而近期研究考察了分布最初未知的潘多拉魔盒在线变体。本文研究在线设定下的潘多拉魔盒问题,并引入上下文。在每一轮中,我们面对若干备选方案,每个方案具有上下文、探索成本以及从未知分布抽取且每轮可能变化的未知价值。我们的主要成果是一个无遗憾算法,其表现可与确切知晓所有先验分布的最优算法相媲美。我们的算法即使在bandit设定下也有效,即算法永远无法得知未被探索的备选方案的价值。实现该结果的关键技术是对上下文bandit中可实现性条件的新颖改进,该改进将上下文与每个备选方案分布的充分统计量(其“保留价值”)而非均值相关联。
引用
@article{arxiv.2205.13114,
title = {Contextual Pandora's Box},
author = {Alexia Atsidakou and Constantine Caramanis and Evangelia Gergatsouli and Orestis Papadigenopoulos and Christos Tzamos},
journal= {arXiv preprint arXiv:2205.13114},
year = {2025}
}