中文

高效路径与密集奖励:大型语言模型的概率流推理

人工智能 2026-01-15 v1

摘要

高质量的思维链已展现出解锁大型语言模型推理能力的巨大潜力。然而,当前范式通常将推理过程视为不可分割的序列,缺乏量化逐步信息增益的内在机制。这种粒度差距表现为两个局限性:缺乏显式指导的冗余探索导致的推理低效,以及因稀疏结果监督或昂贵的外部验证器而导致的优化困难。在本工作中,我们提出 CoT-Flow,一个将离散推理步骤重新概念化为连续概率流的框架,量化每一步对真值答案的贡献。基于此表述,CoT-Flow 实现了两种互补方法:流引导解码,采用基于流的贪心解码策略以提取信息高效的推理路径;以及基于流的强化学习,构建无验证器的密集奖励函数。在具有挑战性的基准上的实验表明,CoT-Flow 在推理效率与推理性能之间实现了优越的平衡。

关键词

引用

@article{arxiv.2601.09260,
  title  = {Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models},
  author = {Yan Liu and Feng Zhang and Zhanyu Ma and Jun Xu and Jiuchong Gao and Jinghua Hao and Renqing He and Han Liu and Yangdong Deng},
  journal= {arXiv preprint arXiv:2601.09260},
  year   = {2026}
}