大语言模型通过潜在蒸馏进行探索
广义相对论与量子宇宙学
2026-05-25 v2
摘要
生成多样化响应对于大语言模型 (LLM) 的测试时间扩展至关重要,但标准随机抽样大多产生表面级别的词汇变化,限制了语义探索。在本文中,我们提出了探索性抽样 (ESamp),这是一种解码方法,显式鼓励生成期间的语义多样性。ESamp 源于神经网络趋势:它们倾向于对之前遇到的输入做出较低的预测误差,而对 novel 的输入则产生更高的预测误差。基于这一属性,我们在测试时间训练一个轻量级 Distiller 来预测 LLM 深度层次的隐藏表示,从其浅层表示中建模 LLM 的深度表示转换。在解码期间,Distiller 持续适应当前生成上下文所诱导的映射。ESamp 使用预测误差作为 novel 信号来重新加权当前前缀条件下的候选 token 扩展,从而将解码偏向于较少探索的语义模式。ESamp 实现为一种异步训练-推理管道,最坏情况下的开销不到 5%(优化后为 1.2%)。经验结果表明,ESamp 显著提升了推理模型的 Pass@k 效率,表现出优于或相当于强随机和启发式基线的性能。特别是,ESamp 在数学、科学和代码生成基准测试中实现了稳健的泛化,并打破了创意写作中多样性与连贯性之间的权衡。我们的代码已在 https://github.com/LinesHogan/tLLM 上发布。
引用
@article{arxiv.2604.24926,
title = {Sensitivity of black hole spectral instability to ultraviolet perturbations},
author = {Ramin G. Daghigh and Michael D. Green and Guan-Ru Li and Jodin C. Morey and Wei-Liang Qian and Stefan J. Randow},
journal= {arXiv preprint arXiv:2604.24926},
year = {2026}
}
备注
20 pages, 10 figures, regular article