大型语言模型用于人工通用智能(AGI): foundational principles and approaches 的综述
人工智能
2025-01-07 v1 计算机视觉与模式识别
机器学习
摘要
基于大规模预训练基础模型(如视觉语言模型、大型语言模型(LLM)、扩散模型和视觉语言动作(VLA)模型)的生成式人工智能系统,已在广泛的领域和情境中展示了解决复杂且真正非平凡AI问题的能力。特别是,多模态大型语言模型(MLLM)从广泛且多样的数据源学习,能够表现出对世界的丰富而细致的表征,从而提供广泛的能力,包括推理、进行有意义的对话;与人类和其他智能体协作以共同解决复杂问题;以及理解人类的社交和情感方面。尽管如此,基于大规模数据集训练的领先LLM的认知能力仍然是浅表且脆弱的。因此,通用的LLM在其通用能力方面受到严格限制。一系列基础问题——具身化、符号 grounding、因果性和记忆——是LLM实现人类水平通用智能所必须加以解决的。这些概念更贴近人类认知,为LLM提供内在的人类式认知特性,支持实现物理上可信的、语义上有意义的、灵活且更具可泛化能力的知识和智能。本文讨论了上述基础问题,并调查了在LLM中实现这些概念的前沿方法。具体而言,我们讨论了具身化、符号 grounding、因果性和记忆如何被利用以有机方式实现人工通用智能(AGI)。
引用
@article{arxiv.2501.03151,
title = {Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches},
author = {Alhassan Mumuni and Fuseini Mumuni},
journal= {arXiv preprint arXiv:2501.03151},
year = {2025}
}