中文

推理调色板:通过潜在上下文化调制推理以实现可控探索

复变函数 2025-12-22 v1

摘要

探索能力影响大型(视觉)语言模型在推理时间性能和强化学习(RL)训练中的表现,因为随机抽样往往导致冗余的推理路径且高层次多样性有限。本文提出推理调色板(Reasoning Palette),一种新的潜在调制框架,赋予模型一种用于战略性上下文化的随机潜在变量,以在生成标记之前引导其内部规划。该潜在上下文通过从问题-答案对的平均池化嵌入通过变分自编码器(VAE)推断得出,其中每个抽样得到的潜在变量可能编码不同的推理上下文。在推理期间,抽样得到的潜在变量被解码为可学习的标记前缀并拼接到输入提示前,调制模型的内部推理轨迹。如此一来,模型在输出生成前进行内部抽样,以覆盖不同的推理策略,从而塑造整个响应序列的风格和结构。简短的监督微调(SFT)预热阶段允许模型适应此潜在条件。在 RL 优化过程中,推理调色板通过按需注入多样化的推理模式来实现结构化探索,显著提升探索效率和持续学习能力。跨多个推理基准的实验表明,我们的方法能够实现对(视觉)语言模型战略行为的可解释且可控的控制,从而在标准 RL 方法上实现持续的性能提升。

关键词

引用

@article{arxiv.2512.17205,
  title  = {A General Characterization on the Uniqueness Problem of L-Functions and General Meromorphic Functions},
  author = {Sanjay Mallick and Ripan Saha},
  journal= {arXiv preprint arXiv:2512.17205},
  year   = {2025}
}

备注

26 Pages