中文

推理-创造力权衡:通向以创造力解决问题的路径

机器学习 2026-01-05 v1

摘要

最先进的大语言模型(LLM)管道依赖于自举推理循环:对样本多样化的思考链进行采样,并强化得分最高的链,主要优化正确性。我们分析了这种设计选择如何敏感于模型分布在推理路径上的坍缩,导致语义熵下降,削弱创造性问题解决。为了分析这一失效,我们引入了分布式创造性推理(DCR),将训练定义为通过解答轨迹上的概率测度的梯度流。STaR、GRPO 和 DPO,以及熵奖励和其他方法,都构成了同一损失函数的特例。该框架提供了三个核心结果:(i)多样性衰减定理,描述了正确性基准目标如何导致 STaR、GRPO 和 DPO 采取不同的多样性衰减模式;(ii)设计可确保收敛到稳定且多样的策略,从而有效防止坍缩;(iii)实现这一目标的简单、可操作的配方。DCR 因此为保持正确性和创造性的 LLM 提供了首要原则性配方。

关键词

引用

@article{arxiv.2601.00747,
  title  = {The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving},
  author = {Max Ruiz Luyten and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2601.00747},
  year   = {2026}
}

备注

56 pages, 9 figures, submitted to Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics