软标记,硬事实
计算与语言
2025-09-25 v2 人工智能
机器学习
摘要
在推理 LLM 的思维链(CoT)阶段使用连续标记代替离散标记近期引起了关注,其直觉在于离散标记的连续混合可以同时模拟多条推理路径的叠加。理论结果已正式证明,连续标记具有更强的表达能力,并能更高效地解决特定问题。然而,连续标记的实际应用受到严重训练困难的限制:先前的工作要么仅在预训练离散标记模型的推理阶段使用连续标记,要么必须从真实离散 CoT 蒸馏连续 CoT,且面临将 CoT 限制在极少标记上的计算成本。这是首个引入可扩展方法通过强化学习(RL)学习连续 CoT 的工作,无需从参考离散 CoT 蒸馏。我们使用“软”标记:将标记混合与输入嵌入上的噪声相结合,以提供 RL 探索。其计算开销极小,使我们能够学习包含数百个标记的连续 CoT。在使用高达 8B 参数的 Llama 和 Qwen 模型的数学推理基准上,使用连续 CoT 训练在 pass@1 上与离散标记 CoT 持平,并在 pass@32 上超越后者,显示出更高的 CoT 多样性。在系统性比较中,表现最佳的场景是使用连续 CoT 标记进行训练,然后在推理时使用离散标记,这意味着“软”模型可以以标准方式部署。最后,我们表明连续 CoT RL 训练能更好地保留基础模型在域外任务上的预测,从而对基础模型提供更温和的调整。
引用
@article{arxiv.2509.19170,
title = {Soft Tokens, Hard Truths},
author = {Natasha Butt and Ariel Kwiatkowski and Ismail Labiad and Julia Kempe and Yann Ollivier},
journal= {arXiv preprint arXiv:2509.19170},
year = {2025}
}