中文

固定预算下风险对待的最佳臂集识别

机器学习 2025-10-27 v2

摘要

在不确定环境下的决策,即在最大化预期奖励的同时最小化其风险,是许多领域中普遍存在的问题。本文引入了随机 bandit 优化中的一种新问题设定,联合关注决策的两个关键方面:最大化预期收益和最小化其关联不确定性,量化方式为均值-方差 (Mean-Variance, MV) 准则。不同于传统 bandit 形式仅关注期望收益,我们的目标是在高效准确地识别在期望表现与风险之间取得最佳权衡的臂的帕累托最优集。我们提出了一种统一的元算法框架,能够在固定置信度和固定预算两个场景下运行,通过针对每个场景设计自适应的置信区间实现,同时采用相同的样本探索策略。我们在两种设置下对返回解的正确性提供了理论保证。为补充这一理论分析,我们在合成基准上进行了大量实证评估,表明该方法在准确性和样本效率方面均优于现有方法,凸显了其在不确定环境下风险感知决策任务中的广泛适用性。

关键词

引用

@article{arxiv.2506.22253,
  title  = {Risk-Averse Best Arm Set Identification with Fixed Budget and Fixed Confidence},
  author = {Shunta Nonaga and Koji Tabata and Yuta Mizuno and Tamiki Komatsuzaki},
  journal= {arXiv preprint arXiv:2506.22253},
  year   = {2025}
}