从思考到输出:链条思考与文本生成在推理语言模型中的特征
计算与语言
2025-06-30 v1 人工智能
密码学与安全
摘要
近期来,大型语言模型(LLM)在复杂推理方面取得了显著进展,但现有研究在系统性比较这些模型的推理过程与输出,尤其是关于其自我反思模式(亦称“啊哈时刻”)以及跨领域的相互关联性方面仍显不足。本文提出了一种新框架,通过关键词统计和LLM评判范式,对四个最前沿大型推理模型(GPT-o1、DeepSeek-R1、Kimi-k1.5和Grok-3)的推理特征进行分析。我们的 метод将其内部思考过程与最终输出相连接。该研究构建了多样化数据集,包含涵盖逻辑推演、因果推断和多步骤问题解决的真实场景问题。此外,提出了一组指标,用于评估推理连贯性和输出准确性。研究结果揭示了这些模型在平衡探索与开发、处理问题和得出结论方面的各种模式。通过定量和定性比较,识别出这些模型在推理深度、中间步骤依赖程度以及其思考过程与输出模式与GPT-o1的相似度等方面存在差异。本工作为在计算效率与推理鲁棒性之间的权衡提供了有价值的见解,并为实际应用中的模型设计与评估提供了实用建议。我们公开项目:https://github.com/ChangWenhan/FromThinking2Output
引用
@article{arxiv.2506.21609,
title = {From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models},
author = {Junhao Liu and Zhenhao Xu and Yuxin Fang and Yichuan Chen and Zuobin Ying and Wenhan Chang},
journal= {arXiv preprint arXiv:2506.21609},
year = {2025}
}
备注
18 pages, 3 figures