多 Token 散度:测量与引导上下文计算密度
机器学习
2025-12-30 v1
摘要
测量语言模型的上下文计算量是一项关键挑战,因为 next-token loss 等指标无法捕捉推理复杂性。基于隐状态可压缩性的现有方法可能具有侵入性且不稳定。我们提出了多 Token 散度(MTD),一种简单的计算量度量,定义为模型完整输出分布与浅层辅助预测头输出分布之间的 KL 散度。MTD 可直接从具有多个预测头的预训练模型中计算,无需额外训练。在此基础上,我们引入了散度引导,一种用于控制生成文本计算特性的新型解码方法。我们实证表明,MTD 在区分复杂任务与简单任务方面比现有方法更有效。在数学推理基准上,MTD 与问题难度呈正相关。较低的 MTD 与更准确的推理相关。MTD 提供了一种实用、轻量级的工具,用于分析和引导语言模型的计算动态。
引用
@article{arxiv.2512.22944,
title = {Multiple Token Divergence: Measuring and Steering In-Context Computation Density},
author = {Vincent Herrmann and Eric Alcaide and Michael Wand and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2512.22944},
year = {2025}
}