通过大语言模型微调的 Thompson 采样
机器学习
2026-03-02 v4 人工智能
摘要
大规模非结构化离散空间中的贝叶斯优化常因求解获取函数的计算成本受限于缺乏梯度。我们提出一种基于 Thompson 采样的可扩展替代方案,通过直接参数化候选者产生最大奖励的概率来消除获取函数最大化的需求。我们的方法,Thompson Sampling via Fine-Tuning(ToSFiT),利用 prompt-conditioned 大语言模型中嵌入的先验知识,并逐步适应后验。理论上,我们推导了一个用于变分 Thompson 采样的 novel 后悔界,匹配其标准版本的强有力保证。我们的分析揭示了对最大化概率后验适应的 critical 作用 —— 这一原则支撑了我们的 ToSFiT 算法。实验上,我们在三个 diverse 任务上验证了该方法:FAQ 响应细化、热力学稳定蛋白搜索和量子电路设计。在覆盖 in-context Bayesian optimization、强化学习和进化搜索的方法集合中,ToSFiT 在 sample efficiency 和计算 efficiency 方面表现出优异。
关键词
引用
@article{arxiv.2510.13328,
title = {Thompson Sampling via Fine-Tuning of LLMs},
author = {Nicolas Menet and Aleksandar Terzić and Michael Hersche and Andreas Krause and Abbas Rahimi},
journal= {arXiv preprint arXiv:2510.13328},
year = {2026}
}
备注
accepted at ICLR 2026