思无声,思快速:LLM推理链的动态潜在压缩
计算与语言
2026-02-04 v6
摘要
大型语言模型(LLM)通过链式思维(CoT)推理实现卓越性能,但这些基于标记的推理链计算昂贵且效率低下。在本文中,我们引入压缩潜在推理(CoLaR),一种通过两阶段训练动态压缩推理过程的潜在空间框架。首先,在监督微调期间,CoLaR超越下一个标记预测,纳入辅助的下一个压缩嵌入预测目标。该过程通过从预定义范围内随机抽样的压缩因子合并连续标记的嵌入,并训练专用潜在头来预测后续压缩嵌入的分布。其次,我们通过强化学习(R)L增强CoLaR,利用潜在头的非确定性特性探索多样化的推理路径并利用更紧凑的路径。该方法使CoLaR能够:i)在稠密潜在水平上进行推理(即默默地),大幅度减少推理链长度,ii)在推理时通过仅通过提示所需压缩因子来动态调整推理速度。在四个数学推理数据集上进行的大量实验表明,CoLaR在可比压缩比率下比潜在基线方法提高了14.1%的准确率,并将推理链长度缩短了53.3%,仅有4.8%的性能下降。此外,当应用于更具挑战性的数学推理任务时,我们的RL增强CoLaR显示出最高可达5.4%的性能提升,同时大幅度减少潜在推理链长度82.8%。
引用
@article{arxiv.2505.16552,
title = {Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains},
author = {Wenhui Tan and Jiaze Li and Jianzhong Ju and Zhenbo Luo and Ruihua Song and Jian Luan},
journal= {arXiv preprint arXiv:2505.16552},
year = {2026}
}
备注
15 pages, 8 figures