当探索随混合贪婪策略免费而来:多样性感知多臂老虎机中我们还需要UCB吗?
机器学习
2026-03-24 v1 人工智能
计算机视觉与模式识别
摘要
在现代生成式人工智能中,从多个生成模型中进行高效选择日益重要,因为从次优模型采样代价高昂。该问题可被形式化为一个多臂老虎机任务。在多样性感知评估指标下,生成器的非退化混合可以优于任何单个模型,这使得该设置区别于经典的最佳臂识别。因此,先前的方法将上置信界(UCB)探索奖励纳入混合目标。然而,在多个数据集和评估指标上,我们观察到UCB项持续减慢收敛速度,并常常降低样本效率。相比之下,一种简单的“混合-贪婪”策略,无需显式的UCB型乐观项,收敛更快,甚至取得更好的性能,尤其是在难以构建紧置信界的广泛使用的指标(如FID和Vendi)上。我们提供了理论见解来解释这一行为:在透明的结构条件下,多样性感知目标通过偏好内部混合来诱导隐式探索,从而导致对所有臂的线性采样,并为基于熵、基于核和FID型目标提供了次线性遗憾保证。这些结果表明,在用于生成模型选择的多样性感知多臂老虎机中,探索可以从目标几何结构中内在地产生,从而质疑了显式置信奖励的必要性。
引用
@article{arxiv.2603.21716,
title = {When Exploration Comes for Free with Mixture-Greedy: Do we need UCB in Diversity-Aware Multi-Armed Bandits?},
author = {Bahar Dibaei Nia and Farzan Farnia},
journal= {arXiv preprint arXiv:2603.21716},
year = {2026}
}