从噪声到多样性:大语言模型推理中的随机嵌入注入
人工智能
2026-05-13 v1
摘要
近期的软提示研究试图通过向大语言模型(LLM)输入中插入训练好的向量来提升推理能力,然而这种增益究竟源于学习到的内容还是注入行为本身,尚未得到仔细区分。我们研究了随机软提示(RSP),该方法完全跳过训练步骤,将一组新抽取的随机嵌入向量序列附加到输入中。每个 RSP 向量均从拟合预训练嵌入表逐元素均值和方差的各向同性高斯分布中采样得到;该序列不携带任何学习到的内容,但在多种设置下的数学推理基准测试中,其准确率却可与优化的软提示相媲美。其机制分两个阶段展开:由于注意力机制必须吸收一个从未见过的随机位置,前几个生成 token 的分布趋于平坦,推理轨迹产生分支;随着生成的继续,这种影响自然减弱,从而使响应收敛到单一完成结果。我们证明,在推理过程中,RSP 提升了早期 token 的多样性,并结合温度采样,拓宽了 Pass@N(即 N 次尝试中至少有一次正确的概率)。除推理外,我们将同样的效果引入 DAPO 训练,并展示了实际增益。我们的贡献如下:(i) RSP 分离出了最简单的软提示形式——无需训练、每次重新采样——为注入的结构性效应提供了一个统一的视角,这是其他在训练和形式上各异的变体所共有的;(ii) 对底层机制进行了理论和实证验证;(iii) 将应用从推理扩展到了训练。
引用
@article{arxiv.2605.11936,
title = {From Noise to Diversity: Random Embedding Injection in LLM Reasoning},
author = {Heejun Kim and Seungpil Lee and Jewon Yeom and Jaewon Sok and Seonghyeon Park and Jeongjae Park and Taesup Kim and Sundong Kim},
journal= {arXiv preprint arXiv:2605.11936},
year = {2026}
}
备注
30 pages, 5 figures, 6 tables. Under review