超越推理极限:大语言模型的最新进展与开放问题
机器学习
2026-01-06 v2 计算与语言
摘要
近期生成式推理的突破性进展彻底改变了大语言模型(LLM)解决复杂任务的方式,使其能够动态检索、细化和组织信息,形成连贯的多步骤推理链。推理时间扩张、强化学习、监督微调和蒸馏等技术已成功应用于 DeepSeek-R1、OpenAI o1 和 o3、GPT-4o、Qwen-32B 以及各类 Llama 变体等顶尖模型中,显著提升了其推理能力。本文综述了自 2023 年至2025年期间发布的27个顶级大语言模型,如 Mistral AI Small 3 24B、DeepSeek-R1、Search-o1、QwQ-32B 和 Phi-4,分析其核心创新与性能提升。我们还详细概述了多语言大语言模型(MLLM)的最新进展,强调提升跨语言推理能力并缓解英语中心化训练局限的方法。与此同时,我们综述了基于状态空间模型(SSM)的架构进展,包括 Mamba 等模型,相较于基于 Transformer 的方法在长文本处理效率方面表现更佳。我们的分析涵盖训练策略,包括通用优化技术、混合专家(MoE)配置、检索增强生成(RAG)、链式思考(chain-of-thought)提示、自我改进方法以及测试时计算扩张和蒸馏框架。最后,我们指出未来研究的关键挑战,包括实现无需人工监督的多步骤推理、提升链式任务执行中的鲁棒性、在结构化提示与生成式灵活性之间取得平衡,以及增强长上下文检索与外部工具的集成。
引用
@article{arxiv.2503.22732,
title = {Reasoning Beyond Limits: Advances and Open Problems for LLMs},
author = {Mohamed Amine Ferrag and Norbert Tihanyi and Merouane Debbah},
journal= {arXiv preprint arXiv:2503.22732},
year = {2026}
}
备注
The paper is published ICT Express Volume 11, Issue 6, December 2025, Pages 1054-1096