中文

PAK-UCB 基于上下文的联邦学习框架用于提示感知的生成模型和大语言模型选择

机器学习 2025-09-05 v6

摘要

从多个基于提示的生成模型中选择样本生成方案(包括大型语言模型 LLM 和引导式图像和视频生成模型),通常通过选择最大化平均评估得分的模型来实现。然而,这种基于得分的选择忽略了不同模型对于不同类型的文本提示可能获得最佳生成性能的可能性。对各种输入提示识别最佳生成模型可以在减少查询次优模型的成本方面发挥作用。在本工作中,我们探讨了基于不同文本提示对文本生成模型排名可能变化的可能性,并提出了一种在给定输入提示下预测最佳数据生成模型的在线学习框架。提出的 PAK-UCB 算法解决了一个跨臂共享上下文变量的上下文 bandit (CB) 设置,利用生成数据更新用于预测不可见文本提示下每个模型得分的核函数。此外,我们利用随机傅里叶特征 (RFF) 来加速 PAK-UCB 的在线学习过程。我们的数值实验在真实和模拟的文本到图像和图像到文本生成模型上表明,RFF-UCB 成功地在不同样本类型中识别了最佳生成模型。代码可在 github.com/yannxiaoyanhu/dgm-online-select 上获取。

关键词

引用

@article{arxiv.2410.13287,
  title  = {PAK-UCB Contextual Bandit: An Online Learning Approach to Prompt-Aware Selection of Generative Models and LLMs},
  author = {Xiaoyan Hu and Ho-fung Leung and Farzan Farnia},
  journal= {arXiv preprint arXiv:2410.13287},
  year   = {2025}
}

备注

accepted to ICML 2025