中文

POETS:基于计算高效策略集的不确定性感知LLM优化

机器学习 2026-05-11 v1 人工智能 机器学习

摘要

在顺序决策和黑箱优化中平衡探索与开发是一个核心挑战。我们引入POETS(Po\textbf{Po}licy E\textbf{E}nsembles for T\textbf{T}hompson S\textbf{S}ampling),一个新型框架,将不确定性量化与策略优化相结合。我们的方法基于这样一个洞见:采用KL正则化训练的策略隐式地编码了底层奖励函数。基于此,POETS绕过了训练不确定性感知奖励模型并单独拟合策略以该模型的复杂嵌套过程,转而直接训练策略集以捕获经验不确定性,通过匹配隐式编码的奖励函数到在线、引导的数据。为克服策略集对大型语言模型(LLM)所需的昂贵计算和内存约束,POETS利用一种高效架构:该集共享预训练的主干网络,同时通过独立的低秩适应(LoRA)分支保持多样性。在理论上,我们证明POETS隐式地进行KL正则化Thompson抽样,从而继承了O(TγT){\mathcal O}(\sqrt{T \gamma_T})的强累积后悔界。在实证上,我们展示POETS在多样化科学发现领域实现了最先进的样本效率,包括蛋白质搜索和量子电路设计。此外,它改进了强化学习的优化轨迹,特别在经验回放或小数据集情境下表现出色。

关键词

引用

@article{arxiv.2605.07775,
  title  = {POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles},
  author = {Nicolas Menet and Andreas Krause and Abbas Rahimi},
  journal= {arXiv preprint arXiv:2605.07775},
  year   = {2026}
}

备注

preprint