从记号到思考:LLM 与人类在压缩与意义之间的权衡
计算与语言
2025-12-03 v6 人工智能
信息论
math.IT
摘要
人类将知识组织成紧凑的概念类别,这些类别在压缩与语义丰富性之间取得平衡。大语言模型 (LLM) 展现出惊人的语言能力,但它们是否在相同的压缩-意义权衡中导航尚不清楚。我们应用信息瓶颈框架,将人类概念结构与来自 40 多个 LLM 的嵌入进行比较,使用经典分类基准进行测试。我们发现,LLM 大致与人类类别边界对齐,但在细粒度语义区分方面不足。与人类不同,后者保持那些在信息论上不够“高效”的表征,以保留语境细微差别;而 LLM 则积极压缩,实现更优化的信息论压缩,却以语义丰富性为代价。意外的是,编码模型在人类对齐方面优于更大的解码模型,这表明理解和生成依赖于不同的表征机制。训练动力学分析揭示了两个阶段的轨迹:快速的初始概念形成,随后是架构的重组,在此期间,语义处理从深层网络迁移到中层网络,模型发现越来越高效、更稀疏的编码。这些不同策略——LLM 优化压缩,而人类优化适应性实用性——揭示了人工智能与自然智能之间的根本差异。这一工作突显了需要保留对人类理解至关重要的概念“低效”之处的模型的需求。
引用
@article{arxiv.2505.17117,
title = {From Tokens to Thoughts: How LLMs and Humans Trade Compression for Meaning},
author = {Chen Shani and Liron Soffer and Dan Jurafsky and Yann LeCun and Ravid Shwartz-Ziv},
journal= {arXiv preprint arXiv:2505.17117},
year = {2025}
}