中文

LLMOrbit:大型语言模型的循环分类体系——从规模壁垒到智能体AI系统

机器学习 2026-04-17 v2 人工智能 计算机视觉与模式识别 多智能体系统 图像与视频处理

摘要

人工智能领域经历了从基础Transformer架构到接近人类水平性能的推理能力系统的革命。我们提出LLMOrbit,一个涵盖2019-2025年的大型语言模型全面循环分类框架。本次调查通过八个相互关联的轨道维度,考察了超过50个模型,涉及15个组织,记录了定义现代大型语言模型、生成式AI和智能体系统的架构创新、训练方法论和效率模式。我们识别出三个关键危机:(1)数据稀缺(2026-2028年耗尽9-27万亿token),(2)指数级成本增长(5年内从300万美元增至300万美金以上),(3)不可持续的能源消耗(增长22倍),从而确定限制粗暴方法的规模壁垒。我们的分析揭示了突破这一壁垒的六大范式:(1)测试时计算(o1、DeepSeek-R1通过10倍推理计算实现GPT-4水平性能),(2)量化(4-8倍压缩),(3)分布式边缘计算(成本降低10倍),(4)模型合并,(5)高效训练(ORPO降低50%内存),(6)小型专用模型(Phi-4 14B参数模型匹配更大模型)。三个范式转变浮现:(1)后训练收益(RLHF、GRPO、纯RL方法贡献显著,DeepSeek-R1达到79.8% MATH),(2)效率革命(MoE路由提升18倍效率,Multi-head Latent Attention实现8倍KV缓存压缩,使GPT-4水平性能成本降至<每百万token0.30美元),(3)民主化进程(开源Llama 3 88.6% MMLU超越GPT-4 86.4%)。我们提供关于技术(RLHF、PPO、DPO、GRPO、ORPO)的见解,追踪从被动生成向工具型智能体(ReAct、RAG、多智能体系统)的演变,并分析后训练创新。

关键词

引用

@article{arxiv.2601.14053,
  title  = {LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems},
  author = {Badri N. Patro and Vijay S. Agneeswaran},
  journal= {arXiv preprint arXiv:2601.14053},
  year   = {2026}
}