释放大语言模型的真正潜力:一种基于反馈触发的长期多路径解码自校正方法
人工智能
2025-09-10 v1
摘要
大语言模型 (LLMs) 在多种任务中取得了显著性能,但在推理过程中容易生成不正确内容的问题仍然是一个关键的未解决挑战。虽然自校正方法提供了潜在的解决方案,但其有效性受到两个固有限制的阻碍:(1) 缺乏可靠的错误定位指导信号,以及 (2) 传统逐令牌解码范式所施加的有限推理深度。为了解决这些问题,我们提出了反馈触发再生 (FTR),这是一个将用户反馈与增强解码动力学相结合的新颖框架。具体而言,FTR 仅在收到负面用户反馈时才激活响应再生,从而避免了因错误自评估导致的错误传播,同时保留了原本正确的输出。此外,我们引入了长期多路径 (LTM) 解码,它通过延迟序列评估来实现对多条推理轨迹的系统性探索,有效克服了标准逐令牌预测的短视决策特性。在数学推理和代码生成基准上的大量实验表明,我们的框架相比最先进的基于提示的自校正方法,取得了一致且显著的改进。
引用
@article{arxiv.2509.07676,
title = {Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding},
author = {Jipeng Li and Zeyu Gao and Yubin Qi and Hande Dong and Weijian Chen and Qiang Lin},
journal= {arXiv preprint arXiv:2509.07676},
year = {2025}
}