FraPPE:快速高效的偏好型纯粹探索
机器学习
2025-08-25 v1 人工智能
最优化与控制
统计理论
机器学习
统计理论
摘要
偏好型纯粹探索(PrePEx)旨在以给定的置信水平识别出多目标 bandit 中的 Pareto 最优臂的集合,其中奖励向量通过给定的偏好锥 进行排序。尽管 PrePEx 及其变体已被广泛研究,但尚不存在一种计算上高效的算法能够对任意偏好锥的最优下界进行跟踪。我们成功地填补了这一空白,通过高效求解下界中的最小化和最大化问题。首先,我们推导了下界的三个结构性质,yielding a computationally tractable reduction of the minimisation problem(最小化问题的计算可行化简)。随后,我们部署 Frank-Wolfe 优化器来加速下界中最大化问题的求解。借助这些技术,我们在 个臂和 维奖励的 bandit 实例中,以 的时间解决 maxmin 优化问题,这是在文献中显著加速。我们进一步证明,我们提出的 PrePEx 算法 FraPPE 在渐近意义上实现了最优的样本复杂度。最后,我们在合成数据和真实数据集上进行数值实验,表明 FraPPE 在识别精确 Pareto 集方面达到了现有算法中最低的样本复杂度。
引用
@article{arxiv.2508.16487,
title = {FraPPE: Fast and Efficient Preference-based Pure Exploration},
author = {Udvas Das and Apurv Shukla and Debabrota Basu},
journal= {arXiv preprint arXiv:2508.16487},
year = {2025}
}