LTA-thinker:面向大语言模型复杂推理的潜在思考增强训练框架
人工智能
2025-12-17 v3
摘要
大语言模型中的复杂推理可通过Test-Time Scaling (TTS)进行动态优化,以缓解过度思考问题。Coconut、SoftCoT及其变体在持续潜在空间推理方面效果显著,但核心瓶颈仍在于高质量潜在思考的高效生成与利用。drawing from SoftCoT++理论,即潜在思考分布的方差越大,越接近于golden truth分布,我们提出一种潜在思考增强训练框架——LTA-Thinker,从两个角度提升分布方差并增强推理性能。首先,LTA-Thinker基于可学习的先验构建潜在思考生成架构,旨在增加生成潜在思考向量的分布方差,以简化整体结构并提升性能上限。其次,LTA-Thinker引入基于分布的方向性优化范式,联合约束分布局部性与分布尺度。该机制通过多目标共训练策略提高信息效率与计算成本,结合标准监督微调(SFT)损失与两种新损失:语义对齐损失,利用KL散度确保潜在思考与问题语义高度相关;推理聚焦损失,利用对比学习机制引导模型聚焦于最关键的推理步骤。实验表明,LTA-thinker在various baselines中实现了最先进(SOTA)性能,表现出更高的性能上限与更好的扩展效应。
引用
@article{arxiv.2509.12875,
title = {LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning},
author = {Jiaqi Wang and Binquan Ji and Haibo Luo and Yiyang Qi and Ruiting Li and Huiyan Wang and Yuantao Han and Cangyi Yang and jiaxu Zhang and Feiliang Ren},
journal= {arXiv preprint arXiv:2509.12875},
year = {2025}
}